Ir al contenido principalSaltar al contenido

UEmbed: Embeddings multimodales unificados dispersos y densos | Mejora de la recuperación de información mediante representaciones duales | Integración eficiente de búsqueda semántica y por palabras clave en modelos multimodales

UEmbedembeddings multimodalesrepresentaciones dispersasdense embeddingsrecuperación de informaciónmultimodal retrievalespacio latente unificado

Abstract

PROBLEMA: Los sistemas de recuperación suelen usar o bien embeddings densos (buenos para semántica global) o dispersos (buenos para coincidencias de palabras clave exactas), pero integrarlos de forma eficiente en modalidades mixtas (texto/imagen) es complejo. SOLUCIÓN: UEmbed propone una arquitectura que genera simultáneamente representaciones dispersas y densas dentro de un único modelo multimodal unificado. METODOLOGÍA: Utiliza una técnica de cuantización escalar y una función de pérdida balanceada que optimiza ambos tipos de embeddings para que compartan el mismo espacio semántico conceptual. RESULTADOS: UEmbed establece nuevos récords en tareas de recuperación multimodal y "cross-modal", demostrando que la combinación de señales dispersas y densas reduce drásticamente los falsos positivos en búsquedas complejas. RELEVANCIA: Crucial para sistemas RAG que manejan documentos con tablas, imágenes y texto, permitiendo una búsqueda mucho más precisa y eficiente.

Más info: Política de Cookies