Ir al contenido principalSaltar al contenido

Escalado de modelos Visión-Lenguaje-Acción con 100k horas de datos | Cómo entrenar robots con trayectorias del mundo real a gran escala | Aplicación de modelos VLA en robótica autónoma avanzada

Vision-Language-Actionrobótica autónomaVLA modelstrayectorias realesXiaomi Robotics-1manipulación robóticaembodied AI

Abstract

PROBLEMA: La generalización de los robots en entornos del mundo real ha estado limitada por la falta de diversidad y volumen en los datos de trayectorias físicas, lo que impide que los modelos Visión-Lenguaje-Acción (VLA) operen con robustez fuera de laboratorios. SOLUCIÓN: Se presenta Xiaomi-Robotics-1, un modelo diseñado para cerrar la brecha sim-to-real mediante la integración masiva de datos multimodales y una arquitectura optimizada para la ejecución de comandos lingüísticos complejos vinculados a percepciones visuales en tiempo real. METODOLOGÍA: El equipo recopiló y procesó más de 100,000 horas de trayectorias reales utilizando una flota de robots diversos en escenarios variados, aplicando técnicas de escalado similares a las de los LLMs pero aplicadas a tokens de acción dinámica. RESULTADOS: El modelo demuestra una tasa de éxito un 40% superior a los benchmarks anteriores en tareas de "zero-shot generalization" y una capacidad sin precedentes para seguir instrucciones ambiguas en entornos desordenados. RELEVANCIA: Es un hito en la creación de modelos de mundo aplicables a robots de consumo, demostrando que el escalado de datos (scaling laws) también es la clave para la inteligencia física.