Estrategias evolutivas para razonamiento de LLMs: cobertura de razonamiento más amplia que GRPO | Cómo entrenar modelos de lenguaje para razonar con optimización evolutiva de poblaciones en lugar de gradientes de política por grupos (GRPO) | Alternativa a GRPO para mejorar razonamiento, exploración y diversidad de soluciones en el entrenamiento de LLMs
Abstract
PROBLEMA: Los métodos dominantes para entrenar razonamiento en LLMs, como GRPO (Group Relative Policy Optimization, familia RLHF), tienden a concentrar la política en pocos modos de solución y a sobre-optimizar recompensas estrechas, reduciendo la cobertura de estrategias de razonamiento y la robustez ante problemas variados; entender qué alternativa de optimización preserva mejor la diversidad es clave para avanzar. SOLUCIÓN: El paper estudia las estrategias evolutivas (evolution strategies, ES) como método de optimización para razonamiento de LLMs y muestra que, en lugar de estimar gradientes a partir de grupos de respuestas, ES mantiene y evoluciona una población de soluciones, logrando una cobertura de razonamiento más amplia que GRPO. METODOLOGÍA: Los autores comparan sistemáticamente ES y GRPO sobre tareas de razonamiento matemático y lógico, midiendo exactitud, diversidad de soluciones, cobertura de modos de razonamiento y eficiencia de muestreo; el LLM se trata como una política optimizable por caja negra, evolucionando parámetros o consignas y seleccionando por recompensa, con ablaciones sobre tamaño de población y presupuesto de muestras. RESULTADOS: Reportan que ES alcanza una cobertura de razonamiento más amplia que GRPO con el mismo presupuesto de muestras, con mayor diversidad de caminos de solución y mejor robustez, aunque puede quedar por debajo en exactitud pico en tareas muy estrechas; el estudio matiza cuándo conviene cada paradigma y cómo combinarlos. RELEVANCIA: Aporta una alternativa evolutiva al entrenamiento de razonamiento de LLMs, con implicaciones directas para RLHF, exploración, reducción del colapso de diversidad y diseño de pipelines de optimización de políticas más robustos.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.