FINAL Bench: El verdadero cuello de botella para la AGI es la autocorrección
FINAL Bench es el primer benchmark que mide sistemáticamente la metacognición en modelos de lenguaje grandes, enfocándose en la capacidad de los modelos para reconocer y corregir sus propios errores. Se evaluaron nueve modelos SOTA en 100 tareas expertas de 15 dominios, revelando tres hallazgos clave: la recuperación de errores explica el 94,8% de las mejoras con andamios de autocorrección; existe una brecha declarativa-procedimental donde los modelos declaran incertidumbre pero no la corrigen; y las tareas más difíciles se benefician más. El benchmark destaca que la metacognición es el principal obstáculo hacia la AGI.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.