Ir al contenido principalSaltar al contenido
Hugging Face

Construye un modelo de embedding específico de dominio en menos de un día

NVIDIA lanza una receta open source para crear modelos de embedding adaptados a dominios específicos en menos de un día con una sola GPU. Utiliza generación de datos sintéticos a partir de documentos propios mediante NeMo Data Designer, minería de negativos difíciles y fine-tuning contrastivo con NeMo Automodel sobre Llama-Nemotron-Embed-1B-v2. Proporcionan un dataset sintético de su documentación pública y demuestran mejoras superiores al 10% en Recall@10 y nDCG@10. Atlassian aplicó el método en su dataset JIRA, logrando un 26% de mejora en Recall@60. La pipeline facilita evaluación con BEIR, exportación a ONNX/TensorRT y despliegue con NVIDIA NIM para producción.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

NVIDIAmodelos de embeddingfine-tuningRAGdatos sintéticosNeMoLlama-Nemotron
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies