¿La destilación on-policy realmente destila? Del profesor ruidoso a la auto-mejora efectiva de los LLMs | Análisis crítico de cuándo y cómo la destilación on-policy transfiere conocimiento útil o amplifica el ruido del profesor | Estrategias para filtrar y re-ponderar señales de un profesor imperfecto y lograr mejoras sostenidas del modelo estudiante
Abstract
PROBLEMA: La destilación on-policy, en la que un modelo estudiante aprende de las salidas que genera su propia política o un profesor en tiempo de ejecución, se usa para comprimir y mejorar LLMs, pero su mecanismo real está mal comprendido: se asume que transfiere conocimiento útil, aunque en la práctica puede amplificar el ruido del profesor o reforzar sesgos de la política actual. SOLUCIÓN: El paper examina de forma crítica si la destilación on-policy realmente destila conocimiento y propone un camino que va de un profesor ruidoso a la auto-mejora efectiva del estudiante, reformulando cuándo y cómo debe aplicarse esta señal para que produzca mejoras reales. METODOLOGÍA: El estudio combina análisis conceptual con experimentos de destilación on-policy sobre modelos de lenguaje, variando la calidad del profesor y midiendo la evolución de la precisión, la diversidad de salidas y la propagación de errores entre profesor y estudiante a lo largo de iteraciones sucesivas. RESULTADOS: Los experimentos muestran que la destilación on-policy puede fallar en transferir conocimiento cuando el profesor es ruidoso, y que las recetas propuestas —basadas en filtrar o re-ponderar las señales del profesor— convierten esa señal imperfecta en mejoras reales y sostenidas del estudiante, superando a la destilación ingenua y reduciendo la propagación de errores entre generaciones. RELEVANCIA: El trabajo clarifica los límites de la destilación de conocimiento y ofrece pautas operativas para pipelines de auto-mejora e iteración de modelos, un tema central en el entrenamiento eficiente y en el desarrollo de LLMs capaces de mejorarse a sí mismos sin supervisión externa constante.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.