SEED: Destilación On-Policy Auto-Evolutiva para Agentes | Marco de trabajo para agentes que aprenden de su propia ejecución | Mejora de agentes de IA mediante destilación iterativa de políticas
Abstract
PROBLEMA: Los agentes basados en RL suelen sufrir de ineficiencia en la transferencia de conocimiento desde modelos expertos y dificultades para adaptarse a entornos dinámicos durante la destilación. SOLUCIÓN: Se propone SEED (Self-Evolving On-Policy Distillation), un marco donde el proceso de destilación es iterativo y permite al agente refinar su política basándose en su propia interacción con el entorno (on-policy). METODOLOGÍA: Implementan un mecanismo de retroalimentación donde el estudiante genera sus propios datos de entrenamiento que luego son validados y corregidos por una política maestra evolutiva. RESULTADOS: Muestran una mejora significativa en la tasa de éxito en tareas de navegación y manipulación de herramientas en comparación con métodos de destilación offline estáticos. RELEVANCIA: Clave para crear agentes que no solo imitan, sino que mejoran continuamente su capacidad de resolución de problemas en el mundo real.