Ir al contenido principalSaltar al contenido

Escalado de razonamiento latente mediante políticas sustitutas | Optimización eficiente del pensamiento interno en modelos de lenguaje | Cómo mejorar la lógica de los LLMs mediante SLPO

Latent ReasoningSLPOScaling LawsReinforcement LearningSurrogate Policyrazonamiento latenteoptimización de políticas IA

Abstract

PROBLEMA: Escalar las capacidades de razonamiento de los modelos de lenguaje mediante aprendizaje por refuerzo es computacionalmente costoso y difícil de estabilizar cuando se trata de pasos de razonamiento oculto (latente). SOLUCIÓN: Introducen SLPO (Scaling Latent Reasoning via a Surrogate Policy), un método que utiliza una política 'sustituta' para facilitar y destilar el proceso de razonamiento hacia el modelo principal de manera más eficiente. METODOLOGÍA: El marco entrena una política ligera que guía la exploración en el espacio latente de razonamiento, permitiendo que el modelo principal aprenda trayectorias de pensamiento complejas sin la inestabilidad del RL directo en espacios de alta dimensionalidad. RESULTADOS: SLPO logra un rendimiento comparable a modelos mucho más grandes en tareas de matemáticas y lógica, demostrando leyes de escala favorables para el razonamiento latente. RELEVANCIA: Directamente aplicable al entrenamiento de agentes que requieren 'pensar antes de actuar' o resolver problemas de múltiples pasos de forma eficiente.