Ir al contenido principalSaltar al contenido
Hugging Face

IBM y UC Berkeley diagnostican por qué fallan los agentes empresariales usando IT-Bench y MAST

IBM Research y la Universidad de California en Berkeley han colaborado para estudiar los fallos en sistemas de agentes basados en LLM para tareas de automatización IT, como triage de incidentes y acciones en Kubernetes. Utilizando los benchmarks ITBench y la taxonomía MAST, analizaron trazas de ejecución de modelos como Gemini-3-Flash, Kimi-K2 y GPT-OSS-120B. Descubrieron que los modelos frontier fallan de manera aislada, principalmente en verificación, mientras que los open-source sufren fallos en cascada debido a pérdida de contexto y desajustes en razonamiento-acción. Proporcionan recomendaciones accionables, como externalizar la verificación y usar máquinas de estado para control de terminación. Este análisis convierte evaluaciones opacas en diagnósticos estructurados para mejorar la fiabilidad en entornos empresariales.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

IBM ResearchUC BerkeleyITBenchMASTagentes LLMfallos en agentesautomatización IT
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies