Ajuste Fino de VLA Generalizable mediante Anclaje de Representación y Alineación Lenguaje-Acción | Cómo entrenar robots inteligentes con modelos de visión y lenguaje | Técnicas para evitar el olvido en modelos robóticos de lenguaje-acción
Abstract
PROBLEMA: Los modelos de Visión-Lenguaje-Acción (VLA) pre-entrenados a menudo sufren de 'olvido catastrófico' o pérdida de generalización cuando se ajustan para tareas específicas en entornos robóticos nuevos. SOLUCIÓN: Los investigadores proponen un método de ajuste fino generalizable basado en dos pilares: 'Representation Anchoring' (anclaje de representaciones) y un nuevo protocolo de alineación Lenguaje-Acción. METODOLOGÍA: El sistema ancla las representaciones visuales latentes del modelo pre-entrenado durante el fine-tuning para preservar el conocimiento previo, mientras que la alineación lenguaje-acción asegura que las instrucciones verbales se traduzcan de manera coherente en trayectorias físicas. RESULTADOS: El enfoque superó a los métodos de fine-tuning estándar en un 25% en tareas no vistas, manteniendo una alta tasa de éxito tanto en simulaciones como en robots domésticos reales. RELEVANCIA: Crucial para el despliegue de robots inteligentes que necesitan aprender nuevas habilidades sin perder sus capacidades básicas de navegación y comprensión del entorno.