Google lanza el benchmark FACTS: los modelos de IA enfrentan un techo del 70% en precisión factual
Google, en colaboración con Kaggle, ha publicado el benchmark FACTS para evaluar la precisión factual de los modelos de IA, especialmente en sectores como legal, financiero y médico. Define la factualidad en dos escenarios: contextual y de conocimiento mundial. Ningún modelo, incluyendo Gemini 3 Pro, GPT-5 y Claude 4.5 Opus, supera el 70% de precisión, con Gemini 3 Pro liderando al 68.8%. El benchmark consta de cuatro pruebas: paramétrica, búsqueda, multimodal y contextual, con datos públicos y privados disponibles. Destaca la debilidad en tareas multimodales, recomendando combinar modelos con herramientas de búsqueda para mejorar el rendimiento.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.