Ir al contenido principalSaltar al contenido
Hugging Face

VLANeXt: una base de código abierta y orientada a la investigación para la robótica y los modelos visión-lenguaje-acción

VLANeXt se presenta como una base de código sencilla y orientada a la investigación para el desarrollo de modelos robóticos de visión-lenguaje-acción (VLA). El proyecto parte de un modelo base simple estilo RT-2/OpenVLA y, tras más de 500 experimentos, destila 12 recetas prácticas para construir modelos VLA sólidos, como módulo de política dedicado, generación continua de acciones con flow matching, conexión suave entre VLM y política o el uso de múltiples vistas. VLANeXt logra resultados de última generación en los benchmarks LIBERO y LIBERO-plus, mejorando la tasa de éxito media del 69,6 % al 83,9 % frente a OpenVLA-OFT, y también funciona bien en tareas de manipulación con robots reales. La actualización del codebase amplía el estudio con seis baselines representativos: VLANeXt-LAM, VLANeXt-S, VLANeXt-L, VLANeXt-XL, VLANeXt-JEPA y VLANeXt-WAM, que cubren desde backbones más pequeños y grandes hasta aprendizaje de acciones latentes, predicción en espacio latente y modelado mundo-acción. La publicación se acompaña de un artículo en ICML y de recursos abiertos como el código en GitHub, la página del proyecto y una lista curada Awesome VLA & WAM.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

VLANeXtrobóticamodelos visión-lenguaje-acciónmodelos de base robóticosHugging FaceLIBEROWorld Action Models
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies