Construye un modelo de embedding específico de dominio en menos de un día
NVIDIA lanza una receta open source para crear modelos de embedding adaptados a dominios específicos en menos de un día con una sola GPU. Utiliza generación de datos sintéticos a partir de documentos propios mediante NeMo Data Designer, minería de negativos difíciles y fine-tuning contrastivo con NeMo Automodel sobre Llama-Nemotron-Embed-1B-v2. Proporcionan un dataset sintético de su documentación pública y demuestran mejoras superiores al 10% en Recall@10 y nDCG@10. Atlassian aplicó el método en su dataset JIRA, logrando un 26% de mejora en Recall@60. La pipeline facilita evaluación con BEIR, exportación a ONNX/TensorRT y despliegue con NVIDIA NIM para producción.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.