Coevolución unificada de roles retador, solucionador y juez desde cero datos para auto-mejora de modelos | Cómo generar supervisión sintética y problemas de entrenamiento sin datos humanos ni destilación externa | Marco para que un LLM mejore su razonamiento en bucle cerrado generando sus propios datos
Abstract
PROBLEMA: el progreso de los LLM depende de datos humanos costosos o de destilar conocimiento de modelos superiores; hasta ahora no existía un método que permitiera mejorar un modelo de razonamiento partiendo de cero datos, lo que limita la auto-mejora sostenible y escala mal con la demanda de anotaciones. SOLUCIÓN: J-Zero introduce un marco unificado de coevolución entre tres roles —challenger (genera problemas), solver (los resuelve) y judge (evalúa su corrección)— que se entrenan conjuntamente desde cero datos, sin supervisión humana ni destilación externa, de modo que el propio sistema produce su currículo y su supervisión. METODOLOGÍA: los tres componentes coevolucionan en un bucle cerrado: el challenger propone tareas cada vez más difíciles, el solver aprende a resolverlas y el judge aprende a valorar las soluciones; la dificultad escalable emerge del desajuste entre los retos propuestos y la capacidad actual del solver, creando una señal de entrenamiento que se adapta al progreso del modelo. RESULTADOS: el enfoque muestra ganancias consistentes en razonamiento y resolución de problemas usando el propio modelo como fuente de supervisión, demostrando que la auto-mejora sin datos iniciales es viable; el judge coevolucionado mantiene la fidelidad de la señal de entrenamiento incluso cuando el solver supera a los evaluadores iniciales. RELEVANCIA: abre una vía de auto-mejora sin dependencia de datos ni de modelos externos, directamente aplicable a LLMs, agentes y pipelines de RL donde la supervisión sintética escalable es el cuello de botella.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.