Ir al contenido principalSaltar al contenido

Física de la planificación multi-turno de horizonte largo | Destilación on-policy de múltiples profesores para agentes inteligentes | Mejora de la capacidad de planificación en LLMs mediante aprendizaje agéntico

Multi-Turn PlanningAgentic DistillationOn-Policy Learning PhysicsLong-Horizon ReasoningPost-training optimizationMulti-Teacher DistillationCASIA AI

Abstract

PROBLEMA: La planificación en múltiples turnos y de horizonte largo sigue siendo un reto para los LLMs, que suelen fallar al mantener la coherencia en trayectorias de decisión extensas. SOLUCIÓN: El estudio analiza la 'física' detrás de la planificación exitosa y propone un método de destilación agéntica on-policy que utiliza múltiples modelos 'profesores' para guiar el aprendizaje. METODOLOGÍA: Se implementa un marco de destilación donde el agente aprende de las correcciones y trayectorias óptimas generadas por diversos expertos durante su propia ejecución (on-policy), abarcando desde el pre-entrenamiento hasta el post-entrenamiento. RESULTADOS: El método logra una mejora sustancial en la tasa de éxito de tareas que requieren más de 10 pasos de razonamiento, superando a las técnicas de destilación estáticas tradicionales. RELEVANCIA: Proporciona una base teórica y práctica para crear agentes capaces de resolver problemas complejos de ingeniería y ciencia.

Más info: Política de Cookies