Ir al contenido principalSaltar al contenido

LongHorizon-Harness: Avances en agentes de largo horizonte para tareas reales | Evaluación de la persistencia y planificación de agentes IA | Benchmark para tareas complejas de múltiples pasos en agentes autónomos

Long-Horizon Agentsagentes de largo horizontereal-world tasksevaluación de agentesIA autónomaplanificación de tareasbenchmark agéntico

Abstract

PROBLEMA: La mayoría de los benchmarks para agentes de IA se centran en tareas cortas, lo que oculta las deficiencias de los modelos en la planificación a largo plazo, la gestión de la memoria y la recuperación de errores en flujos de trabajo extensos. SOLUCIÓN: LongHorizon-Harness es un nuevo marco de pruebas diseñado específicamente para evaluar agentes en tareas que requieren docenas o cientos de pasos interactivos en entornos del mundo real. METODOLOGÍA: Incluye una suite de tareas diversificadas que van desde la gestión de software hasta la resolución de problemas lógicos multiplataforma, con métricas que penalizan la deriva del objetivo original. RESULTADOS: Las pruebas revelan que incluso los modelos más avanzados (SOTA) degradan su rendimiento exponencialmente a medida que aumenta la longitud del horizonte de la tarea. RELEVANCIA: Proporciona la infraestructura necesaria para desarrollar la próxima generación de agentes capaces de ejecutar proyectos completos de forma autónoma sin intervención humana constante.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies