Nemotron ColEmbed V2: Elevando el estándar en recuperación multimodal con el modelo líder de ViDoRe V3
NVIDIA ha presentado la familia Nemotron ColEmbed V2, una serie de modelos de embedding de interacción tardía en tamaños 3B, 4B y 8B, optimizados para recuperación multimodal precisa en documentos con texto, tablas, gráficos e imágenes. Estos modelos, basados en VLMs como Qwen y Llama, lideran el benchmark ViDoRe V3, ocupando los primeros puestos en sus respectivas clases de parámetros. Extienden el mecanismo ColBERT a entornos multimodales mediante MaxSim para interacciones granulares entre tokens de consulta y documentos. Destacan por mejoras en fusión de modelos y datos sintéticos multilingües, ideales para sistemas RAG empresariales donde la precisión prima sobre la eficiencia de almacenamiento.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.