Ir al contenido principalSaltar al contenido

Optimización de políticas mediante control de entropía de grupo | Mejora de la diversidad en RLHF para modelos de lenguaje | Algoritmo GECO para evitar la redundancia en respuestas de agentes de IA

Policy OptimizationEntropy ControlRLHFOptimización de políticascontrol de entropíaaprendizaje por refuerzoalineación de modelosInternLM

Abstract

PROBLEMA: Los métodos de Reinforcement Learning from Human Feedback (RLHF) estándar a menudo sufren de falta de diversidad en las respuestas o colapsan hacia soluciones subóptimas pero seguras. SOLUCIÓN: Se introduce el Group Entropy-Controlled Policy Optimization (GECO), un algoritmo que regula la entropía a nivel de grupo para equilibrar la explotación del feedback con la exploración de respuestas creativas. METODOLOGÍA: Implementan una función de recompensa modificada que castiga la redundancia técnica dentro de grupos de respuestas similares durante el entrenamiento. RESULTADOS: GECO mejora la robustez y la calidad de las respuestas en tareas de razonamiento multi-paso, superando a PPO tradicional en diversidad sin perder precisión. RELEVANCIA: Este método optimiza la fase de post-entrenamiento de los LLMs para producir respuestas más humanas y menos repetitivas.