El techo del 70% en factualidad: por qué el nuevo benchmark 'FACTS' de Google es una llamada de atención
Google y su equipo FACTS, junto con Kaggle, han lanzado el FACTS Benchmark Suite, un marco integral para evaluar la factualidad de los grandes modelos de lenguaje en escenarios contextuales y de conocimiento del mundo real. Gemini 3 Pro lidera con un 68,8%, pero ningún modelo supera el 70%, destacando debilidades en tareas multimodales como la interpretación de imágenes y gráficos. El benchmark incluye pruebas paramétricas, de búsqueda, visión y grounding, recomendando el uso de RAG para aplicaciones empresariales críticas en legal, finanzas y medicina. Esto subraya que la era de 'confiar pero verificar' continúa vigente.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.