N_0-VTLA: Escalado de modelos Visión-Tacto-Lenguaje-Acción con tokens latentes | Integración de percepción táctil en modelos de IA para robótica | Agentes multimodales con capacidad de respuesta sensorial física avanzada
Abstract
PROBLEMA: La mayoría de los modelos de IA para robótica ignoran el sentido del tacto, centrándose solo en visión y lenguaje, lo que limita enormemente la destreza en tareas de manipulación fina o contacto físico. SOLUCIÓN: Se presenta N_0-VTLA, el primer modelo de escala masiva que integra Visión, Tacto, Lenguaje y Acción (VTLA) utilizando una arquitectura unificada de tokens táctiles latentes. METODOLOGÍA: Entrenan un codificador de tacto que comprime señales de sensores de presión y textura en tokens que el Transformer puede procesar junto con embeddings de texto e imagen. RESULTADOS: El modelo demuestra una tasa de éxito un 30% superior en tareas de ensamblaje y manipulación de objetos delicados en comparación con modelos que solo usan visión. RELEVANCIA: Este avance es un paso gigante hacia la creación de agentes robóticos con "sentido del tacto" real, permitiendo aplicaciones en cirugía robótica, manufactura y servicios domésticos.