AgentOPSD: autodestilación recursiva para aprendizaje por refuerzo agéntico sin profesor externo | Cómo entrenar agentes de IA estables y eficientes a partir de sus propias trayectorias exitosas | Método para escalar agentes con tool use y navegación reduciendo la dependencia de datos de expertos
Abstract
PROBLEMA: El aprendizaje por refuerzo (RL) agéntico, en el que un modelo aprende a operar entornos interactivos como navegadores, APIs y herramientas, sigue dependiendo de recompensas externas y demostraciones de expertos, que son caras, escasas o inexistentes en dominios nuevos. Además, la alta varianza y las recompensas dispersas provocan entrenamientos inestables y colapso de políticas. SOLUCIÓN: AgentOPSD propone la autodestilación recursiva (recursive self-distillation): cada iteración de la política del agente actúa como profesor de la siguiente, destilando las trayectorias de mayor calidad producidas por el propio agente. De este modo el entrenamiento se auto-refuerza sin depender de un profesor externo ni de datos humanos, amplificando progresivamente las conductas exitosas. METODOLOGÍA: Combina RL on-policy con rondas iterativas de destilación: se generan experiencias con la política vigente, se filtran episodios de alta calidad mediante criterios de éxito y consistencia, y se entrena una política nueva que imita y supera a la anterior. El método se evalúa en entornos estandarizados de agentes con herramientas, navegación web y uso de APIs, comparándolo con baselines como PPO, RLHF con reward models y destilación supervisada. RESULTADOS: El enfoque logra mayores tasas de éxito y mejor eficiencia de muestra que los baselines, con entrenamiento más estable y menor dependencia de datos externos; la mejora es acumulativa entre rondas de destilación. RELEVANCIA: Demuestra que los agentes pueden auto-mejorarse sin supervisión externa, un avance clave para sistemas agénticos autónomos, tool use y pipelines de RL a gran escala en los que las demostraciones humanas son el cuello de botella.