Ir al contenido principalSaltar al contenido

Escalado de modelos Visión-Lenguaje-Acción con 100k horas de datos | Cómo entrenar robots con trayectorias del mundo real a gran escala | Aplicación de modelos VLA en robótica autónoma avanzada

Vision-Language-Actionrobótica autónomaVLA modelstrayectorias realesXiaomi Robotics-1manipulación robóticaembodied AI

Abstract

PROBLEMA: La generalización de los robots en entornos del mundo real ha estado limitada por la falta de diversidad y volumen en los datos de trayectorias físicas, lo que impide que los modelos Visión-Lenguaje-Acción (VLA) operen con robustez fuera de laboratorios. SOLUCIÓN: Se presenta Xiaomi-Robotics-1, un modelo diseñado para cerrar la brecha sim-to-real mediante la integración masiva de datos multimodales y una arquitectura optimizada para la ejecución de comandos lingüísticos complejos vinculados a percepciones visuales en tiempo real. METODOLOGÍA: El equipo recopiló y procesó más de 100,000 horas de trayectorias reales utilizando una flota de robots diversos en escenarios variados, aplicando técnicas de escalado similares a las de los LLMs pero aplicadas a tokens de acción dinámica. RESULTADOS: El modelo demuestra una tasa de éxito un 40% superior a los benchmarks anteriores en tareas de "zero-shot generalization" y una capacidad sin precedentes para seguir instrucciones ambiguas en entornos desordenados. RELEVANCIA: Es un hito en la creación de modelos de mundo aplicables a robots de consumo, demostrando que el escalado de datos (scaling laws) también es la clave para la inteligencia física.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies