Entrenamiento de extremo a extremo en tiempo de prueba para contextos largos
Un nuevo paper propone tratar el modelado de lenguaje de contexto largo como un problema de aprendizaje continuo, utilizando un Transformer estándar con atención de ventana deslizante. El modelo aprende en tiempo de prueba mediante predicción del siguiente token, comprimiendo el contexto en sus pesos, y mejora su inicialización con meta-aprendizaje durante el entrenamiento. Este método, denominado TTT-E2E, escala con la longitud del contexto como un Transformer de atención completa, pero mantiene una latencia de inferencia constante independientemente del tamaño del contexto, siendo 2,7 veces más rápido para contextos de 128K. Los experimentos se centran en propiedades de escalado con modelos de 3B entrenados en 164B tokens. El código está disponible públicamente en GitHub.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.