SKT: Entrenamiento de uso de habilidades a escala mediante datos sintéticos verificados | Cómo mejorar el uso de herramientas en agentes de IA | Generación de trayectorias verificables para el entrenamiento de agentes LLM
Abstract
PROBLEMA: El entrenamiento de agentes para usar herramientas complejas (habilidades) sufre de escasez de datos reales de alta calidad y la dificultad de verificar si una acción sintética es realmente correcta. SOLUCIÓN: Se presenta SKT (Skill-Use Training), un método para escalar el entrenamiento de habilidades mediante la generación de datos sintéticos que pasan por un proceso de verificación automática rigurosa. METODOLOGÍA: El sistema utiliza un generador para proponer secuencias de uso de herramientas y un verificador basado en reglas y ejecución en entorno real para filtrar solo las trayectorias exitosas, que luego se usan para el ajuste fino del modelo. RESULTADOS: Los modelos entrenados con SKT superan significativamente a los enfoques basados en prompting y a otros métodos de fine-tuning en benchmarks de uso de herramientas como ToolBench. RELEVANCIA: Este enfoque permite que los LLMs se conviertan en agentes operativos mucho más fiables al reducir las alucinaciones en el uso de APIs y herramientas externas.