Los modelos frontera pueden recuperar hasta el 65% de los datos que no recuerdan directamente solo con pensar más tiempo
Un nuevo estudio de Google Research y el Technion demuestra que los modelos de lenguaje de gran tamaño (LLM) suelen tener la información codificada en sus parámetros, pero fallan al intentar recuperarla durante la generación. Los experimentos muestran que modelos frontera como GPT-5 y Gemini-3 codifican entre el 95% y el 98% de los datos probados, aunque no consiguen recordar directamente entre el 26% y el 34% de ellos sin emplear razonamiento adicional. Otorgar más esfuerzo computacional en inferencia permite recuperar entre el 40% y el 65% de los hechos codificados que inicialmente no se recuerdan, un mecanismo que los investigadores comparan con el fenómeno humano de tener la información 'en la punta de la lengua'. El estudio introduce el benchmark WikiProfile y propone pasar de evaluar la precisión por pregunta a perfilar el conocimiento por datos, distinguiendo entre fallos de codificación y fallos de recuerdo. Los autores advierten de que escalar el tamaño del modelo no resuelve este problema y recomiendan a los desarrolladores usar el razonamiento en inferencia de forma selectiva, desplegar pipelines de generar y verificar, y probar el acceso semántico en lugar de limitarse a métricas de precisión.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.