Ir al contenido principalSaltar al contenido

LongStraw: RL de Contexto Largo sobre 2M de Tokens | Cómo entrenar modelos de lenguaje con ventanas de contexto masivas | Optimización de memoria para RL en contextos extremadamente largos

Long-contextReinforcement Learningcontext windowGPU budget optimizationventana de contextoaprendizaje por refuerzoeficiencia computacional

Abstract

PROBLEMA: El entrenamiento de modelos con contextos extremadamente largos (más de 2 millones de tokens) mediante Aprendizaje por Refuerzo (RL) enfrenta barreras prohibitivas de memoria y cómputo bajo presupuestos de hardware fijos. SOLUCIÓN: El paper presenta LongStraw, un método diseñado para habilitar RL de contexto largo optimizando la gestión de memoria y el paralelismo sin exceder un presupuesto de GPU estricto. METODOLOGÍA: Utilizan técnicas de fragmentación selectiva y gestión dinámica de caché para mantener la eficiencia durante la fase de razonamiento y actualización del modelo. RESULTADOS: Logran extender la capacidad de contexto más allá de los 2M de tokens manteniendo el rendimiento en benchmarks de recuperación y razonamiento largo. RELEVANCIA: Es fundamental para el desarrollo de agentes que deben procesar documentos técnicos extensos o bases de código completas en una sola ventana de inferencia.