Ir al contenido principalSaltar al contenido

Optimización de políticas Riemanniana para superar el colapso de exploración en LLMs | Aprendizaje por refuerzo avanzado para modelos de lenguaje | Mejora de estabilidad en RLHF mediante geometría no euclidiana

Riemannian OptimizationReinforcement LearningRLHFExploration CollapsePolicy OptimizationGeometría de RiemannLLM fine-tuning

Abstract

PROBLEMA: El aprendizaje por refuerzo (RL) tradicional en LLMs utiliza recortes euclidianos (clipping) que a menudo conducen al colapso de la exploración, limitando la capacidad del modelo para descubrir mejores respuestas más allá de su política inicial. SOLUCIÓN: Los autores proponen la Optimización de Política Isométrica Riemanniana (RIPO), que abandona el enfoque euclidiano tradicional por uno basado en la geometría del espacio de probabilidad del modelo. METODOLOGÍA: Implementan una técnica que respeta la curvatura del espacio de parámetros de la política, utilizando isometrías para mantener la estabilidad del entrenamiento sin restringir artificialmente la búsqueda de soluciones óptimas. RESULTADOS: RIPO demuestra una mejora sustancial en benchmarks de razonamiento y alineación, superando a PPO tradicional al mantener una mayor entropía de política y una convergencia más estable. RELEVANCIA: Crucial para el desarrollo de modelos que requieren un razonamiento complejo y una alta fidelidad a las preferencias del usuario mediante entrenamiento post-pretraining.