Por qué es crucial superar las métricas de aprendizaje automático demasiado agregadas
Investigadores del MIT han identificado fallos significativos en modelos de aprendizaje automático cuando se aplican a datos distintos de los de entrenamiento, cuestionando la necesidad de pruebas en nuevos entornos. Demuestran que el mejor modelo promedio puede ser el peor en un 6-75% de los nuevos datos debido a correlaciones espurias ocultas por métricas agregadas. Han desarrollado OODSelect, un algoritmo para detectar subpoblaciones problemáticas donde los modelos fallan. Esto es relevante para aplicaciones como diagnósticos médicos con rayos X de tórax y detección de discursos de odio. El estudio se presentó en la conferencia NeurIPS 2025 y libera código para futuras investigaciones.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.