WCM: Un Modelo Crítico de Mundo para RL en Visión-Lenguaje-Acción | Evaluación interna de acciones en modelos de mundo latentes | Mejora de agentes VLA mediante críticas basadas en modelos de mundo
Abstract
PROBLEMA: Los agentes que operan en el espacio Visión-Lenguaje-Acción (VLA) a menudo carecen de una señal de retroalimentación interna sobre las consecuencias de sus acciones antes de ejecutarlas, lo que lleva a un aprendizaje ineficiente. SOLUCIÓN: Se propone el World Critic Model (WCM), un modelo que actúa como un crítico interno capaz de evaluar la "validez" y el "resultado esperado" de una acción dentro de un modelo de mundo latente. METODOLOGÍA: El WCM se entrena para predecir no solo la recompensa, sino la consistencia del estado futuro, integrando señales visuales y textuales para guiar la política de acción. RESULTADOS: La integración de WCM en pipelines de RL mejora la velocidad de convergencia y la robustez del agente frente a cambios inesperados en el entorno. RELEVANCIA: Es un paso clave hacia modelos de mundo que no solo predicen el futuro, sino que lo evalúan críticamente para optimizar la toma de decisiones en tiempo real.