Evaluación de la Cognición Espacial en Píxeles Generativos frente a Texto | Por qué la generación de imágenes es mejor para medir el razonamiento espacial que los LLMs | Benchmark de comprensión del mundo físico para modelos visuales generativos
Abstract
PROBLEMA: La mayoría de las evaluaciones de razonamiento espacial para IA se basan en texto (LLMs), lo cual es una medida indirecta y a menudo sesgada por el aprendizaje estadístico de palabras en lugar de una verdadera comprensión del espacio. SOLUCIÓN: El paper propone evaluar la cognición espacial directamente en el espacio de píxeles generados. Introducen una metodología donde el modelo debe demostrar comprensión espacial (como oclusión, perspectiva y gravedad) mediante la generación precisa de imágenes en lugar de descripciones. METODOLOGÍA: Diseñaron un conjunto de pruebas de 'sentido común físico' que requieren que los modelos completen escenas visuales siguiendo reglas geométricas y espaciales estrictas. RESULTADOS: Los modelos de difusión actuales muestran una comprensión espacial superior a lo que sus habilidades de descripción textual sugieren, aunque fallan estrepitosamente en relaciones de contacto complejas. RELEVANCIA: Fundamental para el desarrollo de 'World Models' que sirven de motor para simulaciones físicas y robótica avanzada.