Ir al contenido principalSaltar al contenido

GAMUT: Benchmark para evaluar la completitud factual con meta-rúbricas | Evaluación avanzada de respuestas abiertas en modelos de lenguaje | Sistema de medición de precisión y alucinaciones en LLMs desarrollado por Meta AI

Factual Completenesscompletitud factualMeta-Rubricsmeta-rúbricashallucination detectiondetección de alucinacionesGAMUT benchmark

Abstract

PROBLEMA: Evaluar la calidad y veracidad de respuestas abiertas generadas por LLMs es subjetivo y difícil de automatizar sin caer en métricas superficiales. SOLUCIÓN: GAMUT presenta un sistema de meta-rúbricas de dos niveles que descompone la calidad de la respuesta en dimensiones atómicas de completitud factual y relevancia. METODOLOGÍA: Utiliza un dataset curado de miles de consultas abiertas con verificaciones de hechos de alta granularidad comparadas contra fuentes de verdad. RESULTADOS: Demuestra que sus métricas tienen una correlación significativamente mayor con el juicio experto humano que benchmarks anteriores como AlpacaEval o MT-Bench. RELEVANCIA: Proporciona una base sólida para reducir las alucinaciones en modelos de lenguaje mediante una evaluación más rigurosa de la precisión de los datos recuperados.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies