Construye un modelo de embeddings específico para un dominio en menos de un día
NVIDIA lanza una guía y herramientas open source para crear modelos de embeddings adaptados a dominios específicos en menos de un día con una sola GPU. El pipeline incluye generación de datos sintéticos a partir de documentos propios usando NeMo Data Designer, minería de negativos duros y ajuste fino con NeMo Automodel sobre Llama-Nemotron-Embed-1B-v2. Proporcionan un dataset sintético de sus documentos públicos que mejora Recall@10 y NDCG@10 en más del 10%. Atlassian aplicó la receta en su dataset JIRA, logrando un 26% de mejora en Recall@60. El modelo se puede exportar a ONNX/TensorRT y desplegar con NVIDIA NIM para producción.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.