Ir al contenido principalSaltar al contenido

Escalando el pre-entrenamiento multimodal nativo desde cero | Modelos de lenguaje y visión integrados de alto rendimiento | Estudio de Tencent sobre el entrenamiento de modelos fundacionales multimodales complejos

Native Multimodal Pre-trainingTencent HunyuanMultimodalidad nativa AIScaling laws AI multimodalesModelos de mundo visualesPre-entrenamiento de visión y lenguajeHunyuan architecture AI

Abstract

PROBLEMA: La mayoría de modelos multimodales actuales se construyen conectando codificadores visuales pre-entrenados a LLMs, lo que crea un cuello de botella en la alineación profunda de sentidos. SOLUCIÓN: Tencent presenta un estudio sobre el escalado de modelos multimodales entrenados de forma nativa desde el inicio ('from scratch'), integrando visión y lenguaje en un solo flujo de aprendizaje activo. METODOLOGÍA: Utilizan un dataset curado de billones de tokens visuales y textuales coordinados, evaluando el rendimiento a medida que aumentan los parámetros y el cómputo. RESULTADOS: Los modelos nativos muestran una comprensión espacial y un razonamiento visual-textual muy superior a los modelos 'pegados' tradicionales, especialmente en tareas de comprensión de modelos de mundo. RELEVANCIA: Este enfoque marca el camino hacia la construcción de Modelos de Mundo más robustos y agentes que entienden el entorno físico de manera inmediata.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies