LongStraw: RL de contexto largo más allá de 2M de tokens | Cómo optimizar entrenamiento de RL para secuencias masivas con presupuesto fijo | Framework para extender la ventana de contexto en LLMs mediante aprendizaje por refuerzo eficiente
Abstract
PROBLEMA: El entrenamiento mediante Aprendizaje por Refuerzo (RL) para contextos extremadamente largos (más de 2 millones de tokens) enfrenta barreras prohibitivas de costo computacional y memoria de GPU, limitando la capacidad de los modelos para razonar sobre documentos masivos. SOLUCIÓN: El paper presenta LongStraw, un framework de RL diseñado para optimizar el uso de recursos bajo un presupuesto fijo de GPU mediante una gestión de memoria ultraeficiente y paralelismo de secuencias. METODOLOGÍA: Utilizan técnicas de fragmentación selectiva y compresión de estados intermedios durante el entrenamiento on-policy para mantener la estabilidad del gradiente en secuencias de longitud sin precedentes. RESULTADOS: Logran entrenar modelos con capacidades de hasta 2M de tokens sin degradar el rendimiento en tareas de recuperación de información ni aumentar linealmente el gasto de hardware. RELEVANCIA: Es fundamental para el desarrollo de agentes que procesan bases de código completas o bibliotecas técnicas extensas de manera nativa.