Nemotron ColEmbed V2: Elevando la vara en recuperación multimodal con el mejor modelo de ViDoRe V3
NVIDIA ha lanzado la familia Nemotron ColEmbed V2, modelos de embedding de interacción tardía en tamaños 3B, 4B y 8B para recuperación multimodal precisa. Estos modelos lideran los benchmarks ViDoRe V1, V2 y V3, ocupando los primeros puestos en ViDoRe V3 según su clase de peso. Basados en VLMs como Qwen3-VL y Llama-3.2, incorporan autoatención bidireccional y el mecanismo MaxSim de ColBERT adaptado a multimodal. Destacan por su precisión en documentos visuales complejos, ideales para sistemas RAG en entornos empresariales. Las mejoras incluyen fusión de modelos post-entrenamiento y datos sintéticos multilingües enriquecidos.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.