Ir al contenido principalSaltar al contenido

Pass the Baton: Trajectory-Relayed On-Policy Distillation | Pass the Baton: Destilación on-policy mediante relevos de trayectoria | Optimización de transferencia de conocimiento en RL para el entrenamiento de modelos eficientes

On-policy Distillationdestilación on-policyTrajectory Relayrelevo de trayectoriasReinforcement Learningaprendizaje por refuerzomodel optimization

Abstract

PROBLEMA: La destilación de conocimientos en Reinforcement Learning (RL) suele ser ineficiente cuando las políticas del profesor y el alumno divergen significativamente, especialmente en entornos on-policy donde los datos mueren tras su uso. SOLUCIÓN: El paper propone 'Pass the Baton', un método de destilación por relevos de trayectorias. En lugar de copiar solo la política, el profesor transfiere información estructurada de la trayectoria que permite al alumno continuar el aprendizaje desde estados de alta recompensa. METODOLOGÍA: Utiliza un framework de 'relayed on-policy distillation' donde las experiencias se segmentan y se transfieren progresivamente, reduciendo la varianza en el gradiente de la política del alumno. RESULTADOS: El método logra una convergencia mucho más rápida en tareas complejas de control y razonamiento secuencial, superando a los métodos de destilación estándar en entornos dinámicos. RELEVANCIA: Esta técnica es fundamental para entrenar modelos más pequeños (estudiantes) que hereden capacidades de razonamiento complejo de modelos gigantes (profesores) de forma más eficiente y estable.

Más info: Política de Cookies