GAMUT: Benchmark para evaluar la completitud factual con meta-rúbricas | Evaluación avanzada de respuestas abiertas en modelos de lenguaje | Sistema de medición de precisión y alucinaciones en LLMs desarrollado por Meta AI
Abstract
PROBLEMA: Evaluar la calidad y veracidad de respuestas abiertas generadas por LLMs es subjetivo y difícil de automatizar sin caer en métricas superficiales. SOLUCIÓN: GAMUT presenta un sistema de meta-rúbricas de dos niveles que descompone la calidad de la respuesta en dimensiones atómicas de completitud factual y relevancia. METODOLOGÍA: Utiliza un dataset curado de miles de consultas abiertas con verificaciones de hechos de alta granularidad comparadas contra fuentes de verdad. RESULTADOS: Demuestra que sus métricas tienen una correlación significativamente mayor con el juicio experto humano que benchmarks anteriores como AlpacaEval o MT-Bench. RELEVANCIA: Proporciona una base sólida para reducir las alucinaciones en modelos de lenguaje mediante una evaluación más rigurosa de la precisión de los datos recuperados.