Ir al contenido principalSaltar al contenido

Estrategias evolutivas para razonamiento de LLMs: cobertura de razonamiento más amplia que GRPO | Cómo entrenar modelos de lenguaje para razonar con optimización evolutiva de poblaciones en lugar de gradientes de política por grupos (GRPO) | Alternativa a GRPO para mejorar razonamiento, exploración y diversidad de soluciones en el entrenamiento de LLMs

evolution strategiesLLM reasoningGRPOoptimización de políticasrazonamiento en modelos de lenguajediversidad de solucionesRLHFexploraciónpolicy optimizationcobertura de razonamiento

Abstract

PROBLEMA: Los métodos dominantes para entrenar razonamiento en LLMs, como GRPO (Group Relative Policy Optimization, familia RLHF), tienden a concentrar la política en pocos modos de solución y a sobre-optimizar recompensas estrechas, reduciendo la cobertura de estrategias de razonamiento y la robustez ante problemas variados; entender qué alternativa de optimización preserva mejor la diversidad es clave para avanzar. SOLUCIÓN: El paper estudia las estrategias evolutivas (evolution strategies, ES) como método de optimización para razonamiento de LLMs y muestra que, en lugar de estimar gradientes a partir de grupos de respuestas, ES mantiene y evoluciona una población de soluciones, logrando una cobertura de razonamiento más amplia que GRPO. METODOLOGÍA: Los autores comparan sistemáticamente ES y GRPO sobre tareas de razonamiento matemático y lógico, midiendo exactitud, diversidad de soluciones, cobertura de modos de razonamiento y eficiencia de muestreo; el LLM se trata como una política optimizable por caja negra, evolucionando parámetros o consignas y seleccionando por recompensa, con ablaciones sobre tamaño de población y presupuesto de muestras. RESULTADOS: Reportan que ES alcanza una cobertura de razonamiento más amplia que GRPO con el mismo presupuesto de muestras, con mayor diversidad de caminos de solución y mejor robustez, aunque puede quedar por debajo en exactitud pico en tareas muy estrechas; el estudio matiza cuándo conviene cada paradigma y cómo combinarlos. RELEVANCIA: Aporta una alternativa evolutiva al entrenamiento de razonamiento de LLMs, con implicaciones directas para RLHF, exploración, reducción del colapso de diversidad y diseño de pipelines de optimización de políticas más robustos.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies