Ir al contenido principalSaltar al contenido

Escalando el pre-entrenamiento multimodal nativo desde cero | Modelos de lenguaje y visión integrados de alto rendimiento | Estudio de Tencent sobre el entrenamiento de modelos fundacionales multimodales complejos

Native Multimodal Pre-trainingTencent HunyuanMultimodalidad nativa AIScaling laws AI multimodalesModelos de mundo visualesPre-entrenamiento de visión y lenguajeHunyuan architecture AI

Abstract

PROBLEMA: La mayoría de modelos multimodales actuales se construyen conectando codificadores visuales pre-entrenados a LLMs, lo que crea un cuello de botella en la alineación profunda de sentidos. SOLUCIÓN: Tencent presenta un estudio sobre el escalado de modelos multimodales entrenados de forma nativa desde el inicio ('from scratch'), integrando visión y lenguaje en un solo flujo de aprendizaje activo. METODOLOGÍA: Utilizan un dataset curado de billones de tokens visuales y textuales coordinados, evaluando el rendimiento a medida que aumentan los parámetros y el cómputo. RESULTADOS: Los modelos nativos muestran una comprensión espacial y un razonamiento visual-textual muy superior a los modelos 'pegados' tradicionales, especialmente en tareas de comprensión de modelos de mundo. RELEVANCIA: Este enfoque marca el camino hacia la construcción de Modelos de Mundo más robustos y agentes que entienden el entorno físico de manera inmediata.