Ir al contenido principalSaltar al contenido

Hacia LLMs nativos en habilidades: entropía de habilidades para benchmark y entrenamiento de razonamiento a largo plazo | Métrica para medir la composición de habilidades y diagnosticar el razonamiento de horizonte largo en modelos de lenguaje | Marco de evaluación y entrenamiento para reforzar habilidades y planificación extensa en agentes y LLMs

skill entropylong-horizon reasoningbenchmarkingentropía de habilidadesrazonamiento de largo plazocomposición de habilidadesreforzamientoplanificaciónreasoningevaluación

Abstract

PROBLEMA: Los benchmarks estándar evalúan respuestas finales y no capturan si un LLM descompone problemas complejos en habilidades básicas ni cómo se concatenan para el razonamiento de horizonte largo, lo que dificulta diagnosticar y entrenar modelos con capacidad de razonamiento extendido. SOLUCIÓN: El paper propone 'Skill Entropy', una métrica para medir el equilibrio y la composición de habilidades a lo largo de trayectorias de razonamiento, y la utiliza tanto para benchmarking como para guiar el entrenamiento hacia LLMs 'skill-native'. METODOLOGÍA: Se define y calcula la entropía de habilidades sobre las trazas de razonamiento de los modelos, combinando análisis de descomposición de tareas con señales de entrenamiento por refuerzo, y se validan las métricas en modelos de distinta escala. RESULTADOS: La entropía de habilidades condiciona fuertemente el éxito en tareas de horizonte largo y sirve como señal de entrenamiento más informativa que la exactitud bruta, mejorando el rendimiento en razonamiento multi-paso frente a métodos de entrenamiento convencionales. RELEVANCIA: Aporta una métrica generalizable y una estrategia de entrenamiento que refuerzan la planificación y composición de habilidades, esenciales para mejorar el razonamiento de horizonte largo en LLMs y agentes autónomos.

Más info: Política de Cookies