Pre-entrenamiento continuado centrado en representaciones para modelos visión-lenguaje-acción (VLA) | Cómo mejorar modelos robóticos sin escalar más datos, mejorando las representaciones compartidas de visión y lenguaje | Estrategia de entrenamiento para robots que reduce la dependencia de datos robóticos costosos
Abstract
PROBLEMA: los modelos visión-lenguaje-acción (VLA) para robótica dependen de cantidades crecientes de datos robóticos —caros, difíciles de recolectar y heterogéneos— y el simple escalado de datos muestra rendimientos decrecientes; falta una vía de mejora que no pase por recolectar más demostraciones físicas. SOLUCIÓN: el trabajo propone un pre-entrenamiento continuado centrado en representaciones para modelos VLA: en lugar de escalar datos, se mejora la calidad de las representaciones compartidas de visión y lenguaje durante una fase de pre-entrenamiento continuado, de modo que la política de acción posterior se entrena sobre características más sólidas y transferibles. METODOLOGÍA: objetivos de pre-entrenamiento orientados a representación —auto-supervisados y contrastivos— aplicados sobre un VLA base antes del ajuste para control, seguidos de fine-tuning con demostraciones de manipulación; la evaluación compara la vía representation-centric contra el escalado puro de datos en benchmarks de manipulación y control robótico. RESULTADOS: el enfoque produce mejoras de rendimiento en tareas de manipulación comparables o superiores a las obtenidas escalando datos, con un uso sustancialmente menor de demostraciones, y muestra que la calidad de la representación es un factor tan decisivo como el volumen de datos para el éxito del aprendizaje de políticas. RELEVANCIA: ofrece una alternativa de escalado aplicable a modelos de mundo y agentes encarnados, reduce la dependencia de datos robóticos costosos y orienta la investigación hacia mejores representaciones en lugar de solo más datos.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.