Ir al contenido principalSaltar al contenido
Hugging Face Blog

El cuadro de clasificación de agentes abiertos

Elron Bandel e IBM Research han lanzado el "Open Agent Leaderboard", un nuevo marco de evaluación abierto para comparar sistemas de agentes de IA completos, no solo los modelos subyacentes. Este benchmark busca medir la generalidad y el coste de los agentes de IA en diversas tareas, incluyendo codificación, servicio al cliente y soporte técnico. Se basa en seis benchmarks preexistentes y un protocolo unificado para estandarizar las pruebas. La iniciativa es completamente de código abierto, con la herramienta Exgentic para reproducir evaluaciones y un artículo científico que describe la metodología.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Open Agent Leaderboardagentes de IAevaluación de agentesExgenticIBM ResearchHugging Facemodelos de lenguaje
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies