DataSpace: benchmark para agentes de datos con analítica verificable en espacios de trabajo heterogéneos | Cómo evaluar de forma fiable a agentes LLM que analizan datos combinando tablas, SQL, archivos y APIs | Estándar de medición para la calidad de data agents en entornos empresariales reales
Abstract
PROBLEMA: Los data agents (agentes que responden preguntas y ejecutan análisis sobre datos) proliferan, pero carecen de una evaluación estandarizada y verificable que refleje entornos reales de trabajo con fuentes heterogéneas como tablas, bases de datos SQL, archivos planos y APIs; los benchmarks existentes se limitan a una sola fuente, lo que impide comparar avances de forma fiable y detectar fallos de integración. SOLUCIÓN: DataSpace es un benchmark que evalúa agentes de datos en espacios de trabajo heterogéneos con verificación automática de resultados: cada tarea define un workspace multi-fuente y una pregunta analítica con ground truth verificable, permitiendo juzgar no solo la respuesta final sino también la corrección del proceso de análisis y de las consultas ejecutadas. METODOLOGÍA: Se construye una colección de workspaces heterogéneos con metadatos y esquemas variados; las tareas cubren agregaciones, joins entre fuentes, filtros temporales, limpieza de datos sucios y analítica explicativa; la evaluación combina exactitud de la respuesta, validez de las consultas ejecutadas y fidelidad de las explicaciones; se evalúan agentes LLM de última generación con acceso a herramientas y ejecución de código. RESULTADOS: Los resultados revelan brechas importantes entre agentes en escenarios heterogéneos frente a benchmarks de tabla única, con errores frecuentes en integración de esquemas y manejo de datos inconsistentes; el benchmark establece una referencia reproducible, con análisis de errores que clasifica las causas principales de fallo por tipo de fuente. RELEVANCIA: Proporciona métricas fiables para desarrollar y comparar agentes de analítica de datos, un caso de uso central para sistemas RAG agénticos que combinan recuperación, ejecución de código y razonamiento sobre datos heterogéneos en entornos profesionales.