Ir al contenido principalSaltar al contenido

¿La destilación on-policy realmente destila? Del profesor ruidoso a la auto-mejora efectiva de los LLMs | Análisis crítico de cuándo y cómo la destilación on-policy transfiere conocimiento útil o amplifica el ruido del profesor | Estrategias para filtrar y re-ponderar señales de un profesor imperfecto y lograr mejoras sostenidas del modelo estudiante

on-policy distillationdestilación de conocimientoself-improvementauto-mejoranoisy teacherstudent-teacherentrenamiento de LLMs

Abstract

PROBLEMA: La destilación on-policy, en la que un modelo estudiante aprende de las salidas que genera su propia política o un profesor en tiempo de ejecución, se usa para comprimir y mejorar LLMs, pero su mecanismo real está mal comprendido: se asume que transfiere conocimiento útil, aunque en la práctica puede amplificar el ruido del profesor o reforzar sesgos de la política actual. SOLUCIÓN: El paper examina de forma crítica si la destilación on-policy realmente destila conocimiento y propone un camino que va de un profesor ruidoso a la auto-mejora efectiva del estudiante, reformulando cuándo y cómo debe aplicarse esta señal para que produzca mejoras reales. METODOLOGÍA: El estudio combina análisis conceptual con experimentos de destilación on-policy sobre modelos de lenguaje, variando la calidad del profesor y midiendo la evolución de la precisión, la diversidad de salidas y la propagación de errores entre profesor y estudiante a lo largo de iteraciones sucesivas. RESULTADOS: Los experimentos muestran que la destilación on-policy puede fallar en transferir conocimiento cuando el profesor es ruidoso, y que las recetas propuestas —basadas en filtrar o re-ponderar las señales del profesor— convierten esa señal imperfecta en mejoras reales y sostenidas del estudiante, superando a la destilación ingenua y reduciendo la propagación de errores entre generaciones. RELEVANCIA: El trabajo clarifica los límites de la destilación de conocimiento y ofrece pautas operativas para pipelines de auto-mejora e iteración de modelos, un tema central en el entrenamiento eficiente y en el desarrollo de LLMs capaces de mejorarse a sí mismos sin supervisión externa constante.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies