Destilación donde se falla: recuperar señales de aprendizaje de grupos de refuerzo negativos con guía adaptativa del profesor | Cómo aprovechar los errores y muestras fallidas para entrenar modelos más robustos | Destilación on-policy que rescata información valiosa de trayectorias negativas en RL
Abstract
PROBLEMA: En la destilación de políticas y el aprendizaje por refuerzo, los métodos convencionales descartan o devalúan las muestras negativas (trayectorias fallidas), perdiendo información de aprendizaje valiosa; sin embargo, los errores suelen contener señales sobre qué comportamientos evitar y en qué puntos la política se desvía. SOLUCIÓN: El paper propone un método de destilación on-policy que se centra en los grupos negativos (negative RL-groups), redistribuyendo la atención del aprendizaje hacia donde el modelo falla y usando a un profesor adaptativo que guía la corrección de esos errores específicos. METODOLOGÍA: Identifica subgrupos de trayectorias fallidas, los agrupa según el patrón de error, y aplica una guía adaptativa del profesor que prioriza esas regiones de fracaso; combina la destilación de comportamiento correcto con la corrección explícita de errores recurrentes durante el entrenamiento. RESULTADOS: El enfoque mejora la tasa de acierto y la robustez respecto a la destilación on-policy estándar, acelerando la convergencia y reduciendo los errores sistemáticos en tareas de razonamiento y control, especialmente en dominios con alta variabilidad. RELEVANCIA: demuestra que los datos de fracaso, correctamente explotados, son una fuente de señal de alta calidad para entrenar LLMs y agentes, mejorando la eficiencia del aprendizaje por refuerzo y la robustez frente a errores típicos sin necesidad de nuevos datos.