Ir al contenido principalSaltar al contenido

Destilación donde se falla: recuperar señales de aprendizaje de grupos de refuerzo negativos con guía adaptativa del profesor | Cómo aprovechar los errores y muestras fallidas para entrenar modelos más robustos | Destilación on-policy que rescata información valiosa de trayectorias negativas en RL

knowledge distillationon-policy learningreinforcement learningdestilación de conocimientoaprendizaje por refuerzonegative samplesteacher guidancetrayectorias de fracaso

Abstract

PROBLEMA: En la destilación de políticas y el aprendizaje por refuerzo, los métodos convencionales descartan o devalúan las muestras negativas (trayectorias fallidas), perdiendo información de aprendizaje valiosa; sin embargo, los errores suelen contener señales sobre qué comportamientos evitar y en qué puntos la política se desvía. SOLUCIÓN: El paper propone un método de destilación on-policy que se centra en los grupos negativos (negative RL-groups), redistribuyendo la atención del aprendizaje hacia donde el modelo falla y usando a un profesor adaptativo que guía la corrección de esos errores específicos. METODOLOGÍA: Identifica subgrupos de trayectorias fallidas, los agrupa según el patrón de error, y aplica una guía adaptativa del profesor que prioriza esas regiones de fracaso; combina la destilación de comportamiento correcto con la corrección explícita de errores recurrentes durante el entrenamiento. RESULTADOS: El enfoque mejora la tasa de acierto y la robustez respecto a la destilación on-policy estándar, acelerando la convergencia y reduciendo los errores sistemáticos en tareas de razonamiento y control, especialmente en dominios con alta variabilidad. RELEVANCIA: demuestra que los datos de fracaso, correctamente explotados, son una fuente de señal de alta calidad para entrenar LLMs y agentes, mejorando la eficiencia del aprendizaje por refuerzo y la robustez frente a errores típicos sin necesidad de nuevos datos.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies