Pequeños pero potentes: Mejora la precisión en búsqueda multimodal y recuperación de documentos visuales con modelos Llama Nemotron RAG
NVIDIA ha presentado dos modelos compactos Llama Nemotron para recuperación multimodal en documentos visuales: llama-nemotron-embed-vl-1b-v2, un modelo de embedding denso, y llama-nemotron-rerank-vl-1b-v2, un rerankeador cross-encoder. Estos modelos, de 1.7B parámetros, son compatibles con bases de datos vectoriales estándar y permiten búsquedas precisas y de baja latencia en PDFs con texto, imágenes, tablas y gráficos. Sobresalen en benchmarks como ViDoRe V1-V3, DigitalCorpora-10k y Earnings V2, mejorando el Recall@5 hasta un 7%. Empresas como Cadence, IBM y ServiceNow los utilizan para flujos de trabajo en diseño, documentación de infraestructuras y chat con PDFs. Representan una solución comercial eficiente para RAG multimodal, superando limitaciones de licencias de competidores.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.