Problemas estructurales en el benchmarking de IA y el caso de un marco de evaluación unificado
El ecosistema actual de benchmarks de IA sufre problemas como saturación de puntuaciones, opacidad en las fuentes, defectos en pruebas como SWE-bench Verified y silos modales que fragmentan la evaluación. ALL Bench propone un marco unificado de 5 ejes: conocimiento, razonamiento experto, abstracto, metacognición y ejecución, con puntuaciones compuestas ajustadas por cobertura y un sistema de confianza de 3 niveles basado en verificación cruzada. Destaca la metacognición mediante FINAL Bench, revelando grandes diferencias entre modelos frontier, y libera todos los datos y código en Hugging Face y GitHub para reproducibilidad.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.