Ir al contenido principalSaltar al contenido
Hugging Face

FINAL Bench: El verdadero cuello de botella para la AGI es la autocorrección

FINAL Bench es el primer benchmark que mide sistemáticamente la metacognición en modelos de lenguaje grandes, enfocándose en la capacidad de los modelos para reconocer y corregir sus propios errores. Se evaluaron nueve modelos SOTA en 100 tareas expertas de 15 dominios, revelando tres hallazgos clave: la recuperación de errores explica el 94,8% de las mejoras con andamios de autocorrección; existe una brecha declarativa-procedimental donde los modelos declaran incertidumbre pero no la corrigen; y las tareas más difíciles se benefician más. El benchmark destaca que la metacognición es el principal obstáculo hacia la AGI.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

FINAL BenchmetacogniciónautocorrecciónAGIrecuperación de erroresbrecha MA-ERbenchmarks IA
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies