Ir al contenido principalSaltar al contenido

LongHorizon-Harness: Avances en agentes de largo horizonte para tareas reales | Evaluación de la persistencia y planificación de agentes IA | Benchmark para tareas complejas de múltiples pasos en agentes autónomos

Long-Horizon Agentsagentes de largo horizontereal-world tasksevaluación de agentesIA autónomaplanificación de tareasbenchmark agéntico

Abstract

PROBLEMA: La mayoría de los benchmarks para agentes de IA se centran en tareas cortas, lo que oculta las deficiencias de los modelos en la planificación a largo plazo, la gestión de la memoria y la recuperación de errores en flujos de trabajo extensos. SOLUCIÓN: LongHorizon-Harness es un nuevo marco de pruebas diseñado específicamente para evaluar agentes en tareas que requieren docenas o cientos de pasos interactivos en entornos del mundo real. METODOLOGÍA: Incluye una suite de tareas diversificadas que van desde la gestión de software hasta la resolución de problemas lógicos multiplataforma, con métricas que penalizan la deriva del objetivo original. RESULTADOS: Las pruebas revelan que incluso los modelos más avanzados (SOTA) degradan su rendimiento exponencialmente a medida que aumenta la longitud del horizonte de la tarea. RELEVANCIA: Proporciona la infraestructura necesaria para desarrollar la próxima generación de agentes capaces de ejecutar proyectos completos de forma autónoma sin intervención humana constante.

Más info: Política de Cookies