Mejora de la generalización en modelos VLA mediante anclaje de representaciones | Cómo finetunear robots inteligentes sin perder habilidades generales | Alineación lenguaje-acción para robótica robusta
Abstract
PROBLEMA: Los modelos de Visión-Lenguaje-Acción (VLA) suelen sufrir de 'olvido catastrófico' o pérdida de generalización cuando se afinan para tareas robóticas específicas (finetuning), volviéndose rígidos ante nuevos entornos. SOLUCIÓN: Proponen un método de finetuning generalizable mediante el anclaje de representaciones (Representation Anchoring) y una alineación robusta entre las instrucciones de lenguaje y las secuencias de acciones. METODOLOGÍA: Utilizan una pérdida de regularización que ancla las representaciones visuales y textuales a sus estados pre-entrenados mientras se optimizan las cabezas de acción, asegurando que el modelo mantenga su conocimiento general mientras aprende habilidades nuevas. RESULTADOS: Los modelos resultantes muestran una capacidad de transferencia un 40% superior en entornos no vistos previamente en comparación con el finetuning estándar, manteniendo la precisión en la ejecución de tareas. RELEVANCIA: Esencial para el despliegue de robots autónomos en hogares u oficinas donde la variabilidad del entorno es la norma y no la excepción.