Ir al contenido principalSaltar al contenido

ReferTrack: Referencia y Seguimiento para Visión en Agentes Autónomos | Mejora de la persistencia de objetos en robótica mediante instrucciones de lenguaje | Sistema de seguimiento visual basado en lenguaje para entornos dinámicos

Embodied visual trackingseguimiento visual robustoreferring expression generationrobótica cognitivamodelos de mundoVLM systemsReferTrack

Abstract

PROBLEMA: El seguimiento visual en entornos físicos (embodied) enfrenta el desafío de la ambigüedad semántica y los cambios drásticos de perspectiva del agente, donde los métodos tradicionales de tracking fallan al perder la referencia del objetivo. SOLUCIÓN: Se propone ReferTrack, un paradigma de 'Referir y luego Seguir'. El modelo primero establece una conexión semántica robusta entre la instrucción del lenguaje y el objeto antes de iniciar el tracking activo, utilizando un mecanismo de atención cruzada persistente. METODOLOGÍA: Implementan un codificador dual que procesa flujo de vídeo y lenguaje simultáneamente, integrado en un agente con control de cámara activo para compensar el movimiento del cuerpo del robot. RESULTADOS: ReferTrack logra una mejora del 15% en la tasa de éxito de seguimiento en entornos dinámicos comparado con métodos que no utilizan referencias semánticas previas. RELEVANCIA: Es un avance clave para la robótica de servicio y los modelos de mundo donde la interacción lenguaje-visión es necesaria para la navegación y manipulación de objetos.