Auto-destilación sensible a la topología de diamante para agentes multi-turno de llamada a herramientas | Recuperación y tuning para entrenar agentes de tool-calling de forma más eficaz | Técnica para reducir la acumulación de errores durante el entrenamiento de agentes conversacionales
Abstract
PROBLEMA: Los agentes de llamada a herramientas (tool-calling) multi-turno suelen degradarse durante el entrenamiento: la auto-destilación puede amplificar errores y producir trayectorias poco fiables, y la selección de ejemplos de entrenamiento no aprovecha adecuadamente las relaciones entre los pasos de una conversación. SOLUCIÓN: DART-SD (Diamond-topology Aware Retrieval and Tuning for Self-Distillation) propone un método que explota la topología de diamante de las trayectorias multi-turno para recuperar y ajustar ejemplos de auto-destilación de forma más eficaz. Al modelar las conexiones entre llamadas y respuestas, mejora la calidad de los datos de entrenamiento y reduce el efecto de errores encadenados. METODOLOGÍA: El método combina una estrategia de recuperación sensible a la topología de diamante con un proceso de tuning basado en auto-destilación: selecciona subsecuencias de alta calidad para construir datos de entrenamiento y actualiza el agente sobre trayectorias de éxito reales de sus propias interacciones. RESULTADOS: Las evaluaciones muestran mejoras consistentes en el rendimiento de llamada a herramientas y en la fiabilidad de las trayectorias multi-turno frente a métodos de destilación convencionales, reduciendo la acumulación de errores en interacciones largas. RELEVANCIA: Aporta una técnica práctica y autónoma para mejorar agentes de tool-calling sin depender de supervisiones externas costosas, un aspecto central para el despliegue de agentes LLM en entornos reales.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.