Modelo de mundo de vídeo condicionado por acciones para manipulación robótica | Cómo predecir las consecuencias visuales de una acción antes de ejecutarla en el robot | Generador de vídeo acción-estado para planificación y simulación de tareas de manipulación
Abstract
PROBLEMA: la planificación robótica de manipulación exige predecir cómo evolucionará la escena ante cada acción, pero los generadores de vídeo existentes no se condicionan por comandos de actuación de robots y muchas predicciones no son utilizables para control; falta un modelo de mundo basado en vídeo que sea accionable y eficiente. SOLUCIÓN: DreamX-Phi 1.0 es un modelo de mundo de vídeo condicionado por acciones para manipulación robótica: dado el estado visual actual y una acción propuesta, genera el siguiente estado o secuencia de estados, lo que permite anticipar y comparar mentalmente distintas trayectorias antes de ejecutarlas en el robot. METODOLOGÍA: el modelo se entrena sobre demostraciones que alinean comandos de actuación con cambios en el estado visual de la escena, y se evalúa en tareas de manipulación como pick-and-place y control de pinza; la validación cubre tanto la fidelidad de las predicciones visuales como el efecto en el éxito de las tareas planificadas. RESULTADOS: el trabajo reporta predicciones de transición coherentes con la acción dada y una mejora de la planificación al descartar trayectorias cuyos resultados previstos son inviables, con un coste de generación que permite su uso en el bucle de decisión del robot. RELEVANCIA: los modelos de mundo condicionados por acción sustentan el model-based RL y el sim-to-real: permiten que agentes robóticos y sistemas predictivos ensayen mentalmente antes de actuar, una línea prioritaria para el control y la planificación.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.