IBM y UC Berkeley diagnostican por qué fallan los agentes empresariales utilizando IT-Bench y MAST
IBM Research y la Universidad de California en Berkeley han colaborado para estudiar los fallos en sistemas de agentes basados en LLM en tareas de automatización IT real, utilizando los benchmarks ITBench y la taxonomía MAST. Analizaron 310 trazas de ejecución de modelos como Gemini-3-Flash, Kimi-K2 y GPT-OSS-120B, identificando patrones de fallo como verificación incorrecta, terminación prematura y desajuste razonamiento-acción. Los modelos frontier como Gemini fallan de forma aislada, mientras que los abiertos sufren fallos en cascada. Se recomiendan intervenciones como verificación externa, control de terminación mediante máquinas de estado y gestión de contexto para mejorar la fiabilidad de estos agentes en entornos empresariales.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.