Google presenta un benchmark de modelos de IA para el desarrollo en Android
Google ha lanzado 'Android Bench', un leaderboard que evalúa cómo los modelos de IA manejan tareas reales de desarrollo Android extraídas de repositorios públicos de GitHub. Las pruebas incluyen migraciones de código, manejo de cambios entre versiones y correcciones de problemas en wearables, verificadas con tests unitarios. Gemini 3.1 Pro lidera el ranking con el mejor rendimiento, seguido de Claude Opus 4.6, resolviendo entre el 16% y 72% de las tareas. Este benchmark ayuda a los equipos de ingeniería a identificar modelos que entienden las sutilezas de la plataforma Android y mejoran la calidad de las apps. Google asegura la integridad con revisiones manuales y publica todo en GitHub para transparencia.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.