🥃 Destilando embeddings diminutos
NeuML ha lanzado la serie de modelos BERT Hash Embeddings, compuesta por bert-hash-femto-embeddings (244K parámetros, 50 dimensiones), bert-hash-pico-embeddings (448K, 80 dimensiones) y bert-hash-nano-embeddings (970K, 128 dimensiones). Estos micromodelos generan vectores de dimensiones fijas para tareas como similitud semántica, búsqueda semántica, minerÃa de paráfrasis y clasificación de texto. Se entrenaron mediante un proceso de destilación en dos pasos a partir de modelos más grandes como mxbai-embed-xsmall-v1, superando a alternativas como MUVERA con ColBERT en evaluaciones BEIR. Ofrecen un rendimiento competitivo con un tamaño mÃnimo, ideales para entornos de edge computing y bajo recurso. Destacan por su eficiencia en almacenamiento y capacidad para exportarse a frameworks como LiteRT.
Transparencia: Este artÃculo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.