Ir al contenido principalSaltar al contenido
Hugging Face

Pequeños pero potentes: Mejora la precisión en búsqueda multimodal y recuperación de documentos visuales con modelos Llama Nemotron RAG

NVIDIA ha presentado dos modelos compactos Llama Nemotron para recuperación multimodal en documentos visuales: llama-nemotron-embed-vl-1b-v2, un modelo de embedding denso, y llama-nemotron-rerank-vl-1b-v2, un rerankeador cross-encoder. Estos modelos, de 1.7B parámetros, son compatibles con bases de datos vectoriales estándar y permiten búsquedas precisas y de baja latencia en PDFs con texto, imágenes, tablas y gráficos. Sobresalen en benchmarks como ViDoRe V1-V3, DigitalCorpora-10k y Earnings V2, mejorando el Recall@5 hasta un 7%. Empresas como Cadence, IBM y ServiceNow los utilizan para flujos de trabajo en diseño, documentación de infraestructuras y chat con PDFs. Representan una solución comercial eficiente para RAG multimodal, superando limitaciones de licencias de competidores.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

NVIDIALlama Nemotronllama-nemotron-embed-vl-1b-v2llama-nemotron-rerank-vl-1b-v2RAG multimodalrecuperación visualViDoRe
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies