Chain-of-Experience: cadena de vivencias para la mejora continua de LLMs | Como encadenar experiencias de interaccion o razonamiento en secuencias de entrenamiento para que un modelo mejore de forma sostenida en el tiempo | Metodo de self-improvement que combina secuencias de experiencia para reducir olvido y potenciar el razonamiento incremental de modelos grandes
Abstract
PROBLEMA: los LLMs no aprovechan su aprendizaje de forma continua: exponer al modelo a experiencia nueva o interacciones pasadas suele causar una mejora inestable u olvido catastrfico, y el ajuste por etapas no preserva bien lo aprendido. SOLUCION: Chain-of-Experience propone estructurar las interacciones previas en secuencias de experiencia que se usan de forma progresiva como datos de refinamiento, logrando un aprendizaje continuado y sostenido. METODOLOGIA: el metodo construye cadenas de experiencias concatenando episodios de interaccion o razonamiento y las incorpora al entrenamiento incremental del modelo, de manera analogous al chain-of-thought pero sobre eventos y retroalimentacion; se combina con tecnicas para mitigar el olvido y mantener enfermedades generales. RESULTADOS: se reportan mejoras sostenidas a lo largo del tiempo sobre tareas de razonamiento y dialog conversacional, con una reduccion del olvido de capacidades previas al incorporar experiencia iterativa. RELEVANCIA: ofrece una base para self-improvement y aprendizaje continuo en LLMs, conectando con el razonamiento sobre experiencias y con sistemas que necesitan mejorarse a lo largo del tiempo de forma autonoma.
Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.