Ir al contenido principalSaltar al contenido

¿Qué hace buenos los datos agentivos? Una lente ACE sobre generación de datos para agentes LLM | Cómo diseñar y curar datos de entrenamiento de alta calidad para agentes de IA y qué criterios garantizan su utilidad | Marco accionable para auditar y generar datasets de agentes basados en LLMs con mejores propiedades de aprendizaje

agentic datadata generationLLM agentsdatos agentivoscalidad de datostrayectorias de agentesdataset curationfine-tuning de agentesdatos sintéticosagentes de lenguaje

Abstract

PROBLEMA: El rendimiento de los agentes basados en LLMs depende en gran medida de los datos con los que se ajustan, pero no existe un criterio claro y unificado sobre qué hace que un dato sea bueno para entrenar agentes: los datasets se generan de forma ad hoc, con calidad desigual, redundancia y propiedades poco entendidas que limitan el aprendizaje de políticas de agente. SOLUCIÓN: El trabajo propone la lente ACE, un marco de análisis para datos agentivos que descompone la calidad de los datos en dimensiones accionables, y deriva principios concretos para generar y curar datasets que mejoren de forma fiable el comportamiento de los agentes. METODOLOGÍA: Analizan datasets representativos de agentes (trayectorias de interacción, uso de herramientas, razonamiento multi-paso) bajo la lente ACE, identifican los atributos que correlacionan con mejor aprendizaje y validan los principios generando datasets sintéticos controlados que varían esas propiedades; miden el efecto aguas abajo en el rendimiento de agentes ajustados con esos datos, con ablaciones por tamaño y composición. RESULTADOS: Los datasets construidos siguiendo los principios ACE producen mejoras consistentes sobre los datasets ad hoc de tamaño equivalente, y el marco permite explicar por qué algunos datos existentes funcionan mejor que otros, ofreciendo pautas operativas para pipelines de generación y curación. RELEVANCIA: Establece un vocabulario común y criterios accionables para la ingeniería de datos de agentes, directamente aplicable al fine-tuning de agentes LLM, a la generación de datos sintéticos y al diseño de benchmarks de sistemas agénticos.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies