BenchMIRT: ¿qué miden realmente los benchmarks de los modelos de lenguaje?
AI2 (Allen Institute for AI) ha presentado BenchMIRT, un nuevo método para auditar los benchmarks de modelos de lenguaje a nivel de cada pregunta o tarea individual. El método, basado en la Teoría de Respuesta al Ítem multidimensional (MIRT), analiza cómo responden los modelos a cada pregunta para estimar qué capacidades subyacentes impulsan realmente la puntuación de un benchmark. Entrenado con resultados de 100 modelos de lenguaje en 16 benchmarks y más de 34.000 preguntas, BenchMIRT recuperó de forma estable dos dimensiones principales: seguridad y razonamiento general. El análisis reveló que algunos benchmarks como BBQ se asocian más con el razonamiento general que con la seguridad, y que WMDP se comporta de manera distinta a otros benchmarks de seguridad. Además, el método permite reducir los benchmarks a solo un 10% de sus preguntas manteniendo resultados casi idénticos y predice el rendimiento en preguntas no observadas con un 79% de acierto. La herramienta busca hacer la evaluación de los LLM más eficiente, transparente y fácil de interpretar.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.