Ir al contenido principalSaltar al contenido

Física de la planificación multi-turno de horizonte largo | Destilación on-policy de múltiples profesores para agentes inteligentes | Mejora de la capacidad de planificación en LLMs mediante aprendizaje agéntico

Multi-Turn PlanningAgentic DistillationOn-Policy Learning PhysicsLong-Horizon ReasoningPost-training optimizationMulti-Teacher DistillationCASIA AI

Abstract

PROBLEMA: La planificación en múltiples turnos y de horizonte largo sigue siendo un reto para los LLMs, que suelen fallar al mantener la coherencia en trayectorias de decisión extensas. SOLUCIÓN: El estudio analiza la 'física' detrás de la planificación exitosa y propone un método de destilación agéntica on-policy que utiliza múltiples modelos 'profesores' para guiar el aprendizaje. METODOLOGÍA: Se implementa un marco de destilación donde el agente aprende de las correcciones y trayectorias óptimas generadas por diversos expertos durante su propia ejecución (on-policy), abarcando desde el pre-entrenamiento hasta el post-entrenamiento. RESULTADOS: El método logra una mejora sustancial en la tasa de éxito de tareas que requieren más de 10 pasos de razonamiento, superando a las técnicas de destilación estáticas tradicionales. RELEVANCIA: Proporciona una base teórica y práctica para crear agentes capaces de resolver problemas complejos de ingeniería y ciencia.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies