IBM y UC Berkeley diagnostican por qué fallan los agentes empresariales usando IT-Bench y MAST
IBM Research y la Universidad de California en Berkeley han colaborado para estudiar los fallos en sistemas de agentes basados en LLM para tareas de automatización IT, como triage de incidentes y acciones en Kubernetes. Utilizando los benchmarks ITBench y la taxonomía MAST, analizaron trazas de ejecución de modelos como Gemini-3-Flash, Kimi-K2 y GPT-OSS-120B. Descubrieron que los modelos frontier fallan de manera aislada, principalmente en verificación, mientras que los open-source sufren fallos en cascada debido a pérdida de contexto y desajustes en razonamiento-acción. Proporcionan recomendaciones accionables, como externalizar la verificación y usar máquinas de estado para control de terminación. Este análisis convierte evaluaciones opacas en diagnósticos estructurados para mejorar la fiabilidad en entornos empresariales.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.