Ir al contenido principalSaltar al contenido

Superando el colapso de exploración en RL para LLMs mediante Optimización de Políticas Isométricas Riemannianas | Uso de geometría no euclidiana para mejorar el entrenamiento de LLMs con RLHF | Técnica avanzada para estabilizar el aprendizaje por refuerzo en modelos de lenguaje

Riemannian GeometryRLHFExploration Collapsegeometría riemannianaaprendizaje por refuerzo para LLMPolicy Optimizationoptimización de políticas

Abstract

PROBLEMA: El aprendizaje por refuerzo (RL) en modelos de lenguaje grandes suele sufrir de 'colapso de exploración', donde el modelo se vuelve excesivamente confiado en un subconjunto limitado de respuestas, debido a que las técnicas de recorte euclidiano estándar no capturan la verdadera geometría del espacio de políticas. SOLUCIÓN: Los autores proponen la Optimización de Políticas Isométricas Riemannianas (RIPO), que abandona el espacio euclidiano en favor de una métrica que respeta la estructura de información de la red neuronal. METODOLOGÍA: Implementaron un método de optimización que proyecta los gradientes en una variedad riemanniana para asegurar que las actualizaciones de la política mantengan la diversidad estocástica y la estabilidad métrica. RESULTADOS: Los experimentos en benchmarks de alineación demuestran que RIPO supera significativamente a PPO en mantener la diversidad de respuestas y alcanzar mejores recompensas acumuladas sin colapsar en soluciones triviales. RELEVANCIA: Este enfoque es crítico para mejorar la robustez del RLHF y asegurar que los modelos sigan explorando soluciones creativas durante el alineamiento.