Ir al contenido principalSaltar al contenido
Hugging Face

BenchMIRT: ¿qué miden realmente los benchmarks de los modelos de lenguaje?

AI2 (Allen Institute for AI) ha presentado BenchMIRT, un nuevo método para auditar los benchmarks de modelos de lenguaje a nivel de cada pregunta o tarea individual. El método, basado en la Teoría de Respuesta al Ítem multidimensional (MIRT), analiza cómo responden los modelos a cada pregunta para estimar qué capacidades subyacentes impulsan realmente la puntuación de un benchmark. Entrenado con resultados de 100 modelos de lenguaje en 16 benchmarks y más de 34.000 preguntas, BenchMIRT recuperó de forma estable dos dimensiones principales: seguridad y razonamiento general. El análisis reveló que algunos benchmarks como BBQ se asocian más con el razonamiento general que con la seguridad, y que WMDP se comporta de manera distinta a otros benchmarks de seguridad. Además, el método permite reducir los benchmarks a solo un 10% de sus preguntas manteniendo resultados casi idénticos y predice el rendimiento en preguntas no observadas con un 79% de acierto. La herramienta busca hacer la evaluación de los LLM más eficiente, transparente y fácil de interpretar.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

BenchMIRTAI2evaluación de modelos de lenguajebenchmarksTeoría de Respuesta al Ítemseguridadrazonamiento
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies