Por qué es crítico superar las métricas de aprendizaje automático excesivamente agregadas
Investigadores del MIT han identificado fallos significativos en modelos de aprendizaje automático cuando se aplican a datos distintos de los de entrenamiento, lo que plantea dudas sobre la necesidad de pruebas en nuevos entornos. Demuestran que incluso el mejor modelo promedio puede ser el peor en un 6-75% de los nuevos datos debido a correlaciones espurias ocultas. Han desarrollado el algoritmo OODSelect para detectar estos problemas en subpoblaciones específicas, como en diagnósticos de radiografías torácicas o detección de discursos de odio. El estudio, presentado en NeurIPS 2025, advierte sobre los riesgos de estadísticas agregadas que ocultan fallos y propone mejoras para una mayor fiabilidad en IA.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.