VLANeXt: un codebase sencillo y orientado a la investigación para la robótica
Los autores presentan VLANeXt, un codebase de código abierto y orientado a la investigación para construir modelos fundacionales de robótica basados en arquitecturas visión-lenguaje-acción (VLA). A partir de más de 500 experimentos, el equipo ha destilado una serie de recetas prácticas que convierten una línea base simple de estilo RT-2 en un modelo VLA fuerte y eficiente, sin depender únicamente del escalado del modelo. El trabajo, publicado en ICML, alcanza resultados de última generación en el benchmark LIBERO y muestra una notable ventaja en robustez frente a perturbaciones en LIBERO-plus. El codebase ampliado incluye varias líneas base representativas, como VLANeXt-LAM, VLANeXt-JEPA y VLANeXt-WAM, que exploran el aprendizaje de acciones latentes, la predicción en espacio latente y el modelado mundo-acción.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.