StateM: escalado del harness de agentes para alcanzar 95.3% de precisión cruda en Terminal-Bench 2.1 | Cómo mejorar el rendimiento de agentes de IA en tareas de terminal sin cambiar el modelo | Método para lograr resultados de nivel frontera en benchmarks de agentes con un coste de inferencia de solo 15 dólares
Abstract
PROBLEMA: los agentes de IA que operan en entornos de terminal de línea de comandos suelen rendir por debajo de su potencial, y la evaluación con benchmarks como Terminal-Bench no logra capturar el impacto real de la infraestructura de ejecución del agente. La mayoría de los esfuerzos se centran en escalar el modelo y no el entorno que lo rodea. SOLUCIÓN: presenta StateM, un enfoque centrado en el escalado del harness de ejecución del agente (el bucle de agente, la gestión de contexto y la infraestructura de herramientas), mostrando que mejorarlo permite alcanzar un 95.3% de precisión cruda en Terminal-Bench 2.1 e incluso realizar una ejecución de nivel frontera por un coste de solo 15 dólares. METODOLOGÍA: se enfoca en rediseñar y escalar los componentes del harness en lugar del modelo base, con una instrumentación cuidadosa del entorno y del flujo de decisiones del agente. RESULTADOS: consigue 95.3% de precisión cruda en Terminal-Bench 2.1, con una ejecución competitiva de nivel frontera a muy bajo coste de cómputo, lo que sugiere que el harness es un factor determinante del rendimiento. RELEVANCIA: demuestra que el harness, y no solo el modelo, es decisivo para el éxito de sistemas agénticos, un hallazgo clave para el diseño y despliegue de agentes LLM en producción.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.