Ir al contenido principalSaltar al contenido
VentureBeat

El techo del 70% en factualidad: por qué el nuevo benchmark 'FACTS' de Google es una llamada de atención

Google y su equipo FACTS, junto con Kaggle, han lanzado el FACTS Benchmark Suite, un marco integral para evaluar la factualidad de los grandes modelos de lenguaje en escenarios contextuales y de conocimiento del mundo real. Gemini 3 Pro lidera con un 68,8%, pero ningún modelo supera el 70%, destacando debilidades en tareas multimodales como la interpretación de imágenes y gráficos. El benchmark incluye pruebas paramétricas, de búsqueda, visión y grounding, recomendando el uso de RAG para aplicaciones empresariales críticas en legal, finanzas y medicina. Esto subraya que la era de 'confiar pero verificar' continúa vigente.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

FACTS BenchmarkGoogleGemini 3 Profactualidadbenchmarks IAmultimodalRAG
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies