ForgeWM: entrenamiento causal progresivo para modelos de mundo de video accion-condicionales de pocos pasos | Como construir modelos de mundo que predicen varios pasos por delante con entrenamiento causal eficiente para control basado en modelo | Tecnica para mejor extraccion de prediccion a largo plazo y simulacion de escenarios fisicos en robotica y agentes con modelos internos
Abstract
PROBLEMA: los modelos de mundo basados en video accion-condicionales requerir muchos pasos de muestreo en la fase de entrenamiento y en la prediccion, y se vuelven fragiles cuando se les pide predecir horizontes multiples, lo que limita su utilidad para control basado en modelos y planificacion. SOLUCION: ForgeWM propone un entrenamiento causal y progresivo para modelos de mundo de video de pocos pasos de muestreo, mejorando la eficiencia computacional y la calidad de la prediccion a largo plazo para decisiones basadas en el modelo. METODOLOGIA: el metodo usa un curriculum progresivo que entrena el modelo de mundo por etapas, aumentando gradualmente el horizonte de prediccion y combinando generacion de video por condicionamiento por accion; se entrena sobre datos de interaccion con entornos fisicos y se evalua aplicando el modelo de mundo para control. RESULTADOS: consigue modelos de mundo con pocos pasos de muestreo que conservan calidad de prediccion a mas pasos y permiten control competitivo frente a metodos de muchos pasos, con un costo de entrenamiento reducido. RELEVANCIA: los modelos de mundo son fundamentales para la simulacion de la fisica y la planificacion; este trabajo mejora su eficiencia y profundidad, con aplicacion directa a model-based RL, sim-to-real y agentes con modelos internos del entorno.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.