RynnValue: escalado de modelos fundamentales de valor robótico mediante distancia temporal | Cómo aprender funciones de valor para control de robots a escala con señales de distancia temporal | Modelo de valor fundacional para planificación y aprendizaje por refuerzo basado en modelos en robótica
Abstract
PROBLEMA: las funciones de valor en robótica suelen entrenarse por tarea, sin generalizar entre entornos, y requieren recompensas densas difíciles de obtener en el mundo real. SOLUCIÓN: presenta RynnValue, un modelo fundamental de valor robótico que aprende funciones de valor generalizables utilizando la distancia temporal (temporal distance) como señal de entrenamiento, estimando la utilidad de estados y acciones a través de múltiples tareas y entornos. METODOLOGÍA: entrena un modelo de valor a gran escala sobre datos diversos de robótica, usando la distancia temporal entre estados como supervisión para estimar potenciales de recompensa sin depender de recompensas manuales densas. RESULTADOS: muestra mejor generalización y mayor eficiencia de muestra en tareas de control nuevas comparado con métodos entrenados por tarea, escalando a múltiples entornos y plataformas robóticas. RELEVANCIA: aporta a los modelos de mundo y al aprendizaje por refuerzo basado en modelos, sustento de agentes robóticos capaces de planificar y adaptarse a entornos variados sin reentrenamiento por tarea.