Ir al contenido principalSaltar al contenido
VentureBeat

Artificial Analysis renueva su Índice de Inteligencia de IA, sustituyendo benchmarks populares por pruebas del mundo real

Artificial Analysis, una organización independiente de benchmarking de IA, ha lanzado una gran actualización de su Intelligence Index v4.0. Esta renovación elimina benchmarks saturados como MMLU-Pro, AIME 2025 y LiveCodeBench, e introduce evaluaciones nuevas como GDPval-AA, que mide tareas económicamente valiosas en 44 ocupaciones, CritPT para razonamiento científico en física y AA-Omniscience para alucinaciones y conocimiento factual. OpenAI's GPT-5.2 lidera el índice, seguido de Anthropic's Claude Opus 4.5 y Google's Gemini 3 Pro. La recalibración restaura espacio para mejoras futuras y enfoca la medición en acciones útiles económicamente, lo que es relevante para desarrolladores y compradores empresariales al proporcionar métricas más prácticas para la adopción de IA.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Artificial AnalysisIntelligence IndexGDPval-AACritPTAA-OmniscienceGPT-5.2benchmarks IA
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies