Ir al contenido principalSaltar al contenido

OneDayAgent: un arnés de horizonte largo para agentes autónomos | Infraestructura y benchmark para evaluar la autonomía sostenida de agentes durante jornadas completas de trabajo | Marco para entrenar y medir agentes capaces de completar tareas extensas y multi-etapa de forma autónoma

autonomous agentslong-horizonagent harnessagentes autónomoshorizonte largoevaluación de agentesbenchmarkmemoriaplanificacióntool use

Abstract

PROBLEMA: La mayoría de los evaluadores de agentes usan tareas cortas y de un solo paso que no reflejan la autonomía requerida en el mundo real, donde un agente debe planificar y ejecutar muchas subtareas dependientes durante periodos prolongados. SOLUCIÓN: El paper presenta OneDayAgent, un 'arnés de horizonte largo' que define un protocolo unificado para desplegar y evaluar agentes en escenarios que abarcan una jornada completa de actividades, integrando arquitectura de agente, entorno y métricas. METODOLOGÍA: Se construye un entorno rico con múltiples herramientas, memoria y tareas encadenadas de larga duración, y se evalúan diversos agentes sobre su capacidad de planificación, recuperación de errores y consistencia a lo largo del tiempo, comparando con evaluadores de horizonte corto. RESULTADOS: La evaluación de horizonte largo revela degradaciones de rendimiento que los benchmarks tradicionales no detectan, y pone de manifiesto qué arquitecturas y estrategias de memoria sostienen mejor la autonomía prolongada. RELEVANCIA: Proporciona una infraestructura y protocolo de evaluación esenciales para el desarrollo de agentes autónomos robustos y de larga duración, alineados con las necesidades de sistemas agénticos en producción.

Más info: Política de Cookies