Ir al contenido principalSaltar al contenido
Hugging Face

Problemas estructurales en el benchmarking de IA y el caso de un marco de evaluación unificado

El ecosistema actual de benchmarks de IA sufre problemas como saturación de puntuaciones, opacidad en las fuentes, defectos en pruebas como SWE-bench Verified y silos modales que fragmentan la evaluación. ALL Bench propone un marco unificado de 5 ejes: conocimiento, razonamiento experto, abstracto, metacognición y ejecución, con puntuaciones compuestas ajustadas por cobertura y un sistema de confianza de 3 niveles basado en verificación cruzada. Destaca la metacognición mediante FINAL Bench, revelando grandes diferencias entre modelos frontier, y libera todos los datos y código en Hugging Face y GitHub para reproducibilidad.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

ALL BenchFINAL Benchbenchmarks IAmetacogniciónevaluación de modelosleaderboardsverificación cruzada
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies