DecoEvo: Co-evolución desacoplada de habilidades de solver y generador de rúblicas | Optimización iterativa de LLMs mediante rúblicas dinámicas | Cómo mejorar el entrenamiento de modelos de lenguaje con criterios de evaluación evolutivos
Abstract
PROBLEMA: El entrenamiento de modelos de lenguaje a menudo depende de rúblicas estáticas o generadores de rúblicas fijos, lo que limita la capacidad del modelo ('solver') para superar techos de rendimiento cuando sus habilidades evolucionan más rápido que los criterios de evaluación. SOLUCIÓN: DecoEvo propone una co-evolución con desacoplamiento de puntuación entre las capacidades del 'solver' y el generador de rúblicas en el espacio de texto, permitiendo que ambos mejoren de forma iterativa y armonizada. METODOLOGÍA: Utiliza un marco de evolución competitiva donde el generador de rúblicas se ajusta dinámicamente para identificar fallos sutiles en las respuestas del modelo, mientras el modelo aprende a satisfacer criterios cada vez más rigurosos. RESULTADOS: Los experimentos demuestran que DecoEvo supera significativamente a los métodos de optimización tradicionales de rúbrica fija en tareas de razonamiento complejo y codificación. RELEVANCIA: Es fundamental para sistemas de auto-supervisión donde se busca que la IA mejore sin intervención humana constante en el diseño de métricas.