Problemas estructurales en el benchmarking de IA y el caso de un marco de evaluación unificado
El artículo expone los problemas estructurales en el ecosistema de benchmarks de IA, como la saturación de pruebas, opacidad en las fuentes, defectos en benchmarks como SWE-bench Verified y silos por modalidades. Propone ALL Bench, un marco unificado con puntuación compuesta en 5 ejes: conocimiento, razonamiento experto, abstracto, metacognición y ejecución, acompañado de un sistema de confianza por verificación cruzada. Destaca la metacognición mediante FINAL Bench como un factor diferenciador clave entre modelos frontier. Revela asimetrías en VLMs y libera todos los datos en Hugging Face para reproducibilidad.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.