Ir al contenido principalSaltar al contenido

DecoEvo: Co-evolución desacoplada de habilidades de solver y generador de rúblicas | Optimización iterativa de LLMs mediante rúblicas dinámicas | Cómo mejorar el entrenamiento de modelos de lenguaje con criterios de evaluación evolutivos

DecoEvoco-evolutionco-evoluciónrubric-generatormodel optimizationoptimización de modelossolver skillsQwenRLHF

Abstract

PROBLEMA: El entrenamiento de modelos de lenguaje a menudo depende de rúblicas estáticas o generadores de rúblicas fijos, lo que limita la capacidad del modelo ('solver') para superar techos de rendimiento cuando sus habilidades evolucionan más rápido que los criterios de evaluación. SOLUCIÓN: DecoEvo propone una co-evolución con desacoplamiento de puntuación entre las capacidades del 'solver' y el generador de rúblicas en el espacio de texto, permitiendo que ambos mejoren de forma iterativa y armonizada. METODOLOGÍA: Utiliza un marco de evolución competitiva donde el generador de rúblicas se ajusta dinámicamente para identificar fallos sutiles en las respuestas del modelo, mientras el modelo aprende a satisfacer criterios cada vez más rigurosos. RESULTADOS: Los experimentos demuestran que DecoEvo supera significativamente a los métodos de optimización tradicionales de rúbrica fija en tareas de razonamiento complejo y codificación. RELEVANCIA: Es fundamental para sistemas de auto-supervisión donde se busca que la IA mejore sin intervención humana constante en el diseño de métricas.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies