Ir al contenido principalSaltar al contenido

RoboTTT: Escalado de contexto para políticas robóticas mediante TTT | Aplicación de Test-Time Training en memoria robótica de largo alcance | Cómo mejorar la memoria de los robots en tareas secuenciales largas

Robot policiesTest-Time TrainingTTT-layercontext scaling robóticamanipulación autónomaRoboTTTaprendizaje de políticas AI

Abstract

PROBLEMA: Las políticas robóticas actuales están limitadas por ventanas de contexto cortas, lo que les impide recordar acciones pasadas o adaptarse a cambios en entornos dinámicos durante secuencias largas. SOLUCIÓN: RoboTTT integra capas de Test-Time Training (TTT) en las políticas de los robots para permitir un escalado de contexto eficiente, permitiendo al modelo "aprender" de su propia experiencia reciente en tiempo real. METODOLOGÍA: Implementan arquitecturas de aprendizaje por refuerzo donde las capas TTT actualizan pesos específicos durante la inferencia para comprimir el historial de observaciones. RESULTADOS: La arquitectura mostró una mejora drástica en la generalización frente a tareas de larga duración y cambios en la dinámica física del entorno comparado con Transformers tradicionales. RELEVANCIA: Es un avance clave para la autonomía persistente de robots en entornos domésticos e industriales donde la memoria de largo plazo es indispensable.