Ir al contenido principalSaltar al contenido
Hugging Face

IBM y UC Berkeley diagnostican por qué fallan los agentes empresariales utilizando IT-Bench y MAST

IBM Research y la Universidad de California en Berkeley han colaborado para estudiar los fallos en sistemas de agentes basados en LLM en tareas de automatización IT real, utilizando los benchmarks ITBench y la taxonomía MAST. Analizaron 310 trazas de ejecución de modelos como Gemini-3-Flash, Kimi-K2 y GPT-OSS-120B, identificando patrones de fallo como verificación incorrecta, terminación prematura y desajuste razonamiento-acción. Los modelos frontier como Gemini fallan de forma aislada, mientras que los abiertos sufren fallos en cascada. Se recomiendan intervenciones como verificación externa, control de terminación mediante máquinas de estado y gestión de contexto para mejorar la fiabilidad de estos agentes en entornos empresariales.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

IBM ResearchUC BerkeleyITBenchMASTagentes LLMfallos en agentesautomatización IT
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies