Ir al contenido principalSaltar al contenido

ReferTrack: Referencia y Seguimiento para Visión en Agentes Autónomos | Mejora de la persistencia de objetos en robótica mediante instrucciones de lenguaje | Sistema de seguimiento visual basado en lenguaje para entornos dinámicos

Embodied visual trackingseguimiento visual robustoreferring expression generationrobótica cognitivamodelos de mundoVLM systemsReferTrack

Abstract

PROBLEMA: El seguimiento visual en entornos físicos (embodied) enfrenta el desafío de la ambigüedad semántica y los cambios drásticos de perspectiva del agente, donde los métodos tradicionales de tracking fallan al perder la referencia del objetivo. SOLUCIÓN: Se propone ReferTrack, un paradigma de 'Referir y luego Seguir'. El modelo primero establece una conexión semántica robusta entre la instrucción del lenguaje y el objeto antes de iniciar el tracking activo, utilizando un mecanismo de atención cruzada persistente. METODOLOGÍA: Implementan un codificador dual que procesa flujo de vídeo y lenguaje simultáneamente, integrado en un agente con control de cámara activo para compensar el movimiento del cuerpo del robot. RESULTADOS: ReferTrack logra una mejora del 15% en la tasa de éxito de seguimiento en entornos dinámicos comparado con métodos que no utilizan referencias semánticas previas. RELEVANCIA: Es un avance clave para la robótica de servicio y los modelos de mundo donde la interacción lenguaje-visión es necesaria para la navegación y manipulación de objetos.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies