NEO-unify: Construyendo modelos multimodales unificados nativos de principio a fin
SenseTime, en colaboración con la Universidad Tecnológica de Nanyang (NTU), presenta NEO-unify, un paradigma de modelo unificado multimodal nativo y de principio a fin que elimina la necesidad de codificadores de visión (VE) y autoencoders variacionales (VAE). Este enfoque aprende directamente de entradas casi sin pérdida, como píxeles y palabras, mediante una interfaz visual near-lossless, un Mixture-of-Transformer (MoT) nativo y aprendizaje unificado con entropía cruzada autoregresiva para texto y pixel flow matching para visión. NEO-unify destaca en reconstrucción de imágenes (31.56 PSNR en MS COCO), edición de imágenes y eficiencia en el escalado de datos, superando baselines sin priors preentrenados. Los resultados muestran estabilidad en comprensión y generación, con planes para escalar y abrir los modelos próximamente.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.