Ir al contenido principalSaltar al contenido

RynnValue: escalado de modelos fundamentales de valor robótico mediante distancia temporal | Cómo aprender funciones de valor para control de robots a escala con señales de distancia temporal | Modelo de valor fundacional para planificación y aprendizaje por refuerzo basado en modelos en robótica

value functionfunción de valortemporal distancedistancia temporalmodel-based RLaprendizaje por refuerzo basado en modelosroboticsrobóticafoundation modelmodelo fundamentalreward learning

Abstract

PROBLEMA: las funciones de valor en robótica suelen entrenarse por tarea, sin generalizar entre entornos, y requieren recompensas densas difíciles de obtener en el mundo real. SOLUCIÓN: presenta RynnValue, un modelo fundamental de valor robótico que aprende funciones de valor generalizables utilizando la distancia temporal (temporal distance) como señal de entrenamiento, estimando la utilidad de estados y acciones a través de múltiples tareas y entornos. METODOLOGÍA: entrena un modelo de valor a gran escala sobre datos diversos de robótica, usando la distancia temporal entre estados como supervisión para estimar potenciales de recompensa sin depender de recompensas manuales densas. RESULTADOS: muestra mejor generalización y mayor eficiencia de muestra en tareas de control nuevas comparado con métodos entrenados por tarea, escalando a múltiples entornos y plataformas robóticas. RELEVANCIA: aporta a los modelos de mundo y al aprendizaje por refuerzo basado en modelos, sustento de agentes robóticos capaces de planificar y adaptarse a entornos variados sin reentrenamiento por tarea.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies