Ir al contenido principalSaltar al contenido

Chain-of-thought centrado en recuperación con hard negatives para retrieval multimodal unificado | Cómo entrenar modelos de búsqueda para aprender de sus propios errores mediante razonamiento contrastivo | Técnica para aumentar la precisión de RAG multimodal generando explicaciones de por qué un candidato es correcto o incorrecto

chain-of-thoughthard negativesrecuperación multimodalmultimodal retrievalrazonamiento contrastivoaprendizaje a partir de fallosRAG multimodalsemantic embeddings

Abstract

PROBLEMA: La recuperación multimodal unificada (texto, imagen, vídeo y audio) sigue fallando en casos difíciles con candidatos visual o semánticamente similares; los métodos de chain-of-thought (CoT) mejoran el razonamiento en lenguaje, pero rara vez se orientan a la tarea de recuperación ni se entrenan explícitamente con ejemplos negativos, por lo que los errores se repiten. SOLUCIÓN: El paper introduce retrieval-centric CoT, un enfoque que entrena a los modelos a generar cadenas de razonamiento centradas en la recuperación aprendiendo de los fallos: usa hard negatives para que el modelo explique por qué un candidato es incorrecto y justifique la elección correcta, mejorando la discriminación en el espacio de embeddings y la robustez ante distractores. METODOLOGÍA: Se construyen conjuntos de hard negatives mediante minería de anclajes difíciles (candidatos con alta similitud pero etiqueta negativa); el modelo genera razonamientos contrastivos que se integran como contexto en el codificador de consulta; el entrenamiento es conjunto con objetivos de recuperación contrastiva y generación de CoT en una arquitectura unificada multimodal sobre corpus mixtos de texto-imagen-vídeo-audio. RESULTADOS: Reporta mejoras en benchmarks de recuperación multimodal unificada, con ganancias especialmente marcadas en conjuntos de evaluación dura (hard splits) y en modalidades poco representadas; el análisis muestra que el razonamiento generado actúa como regularización semántica del espacio de recuperación y reduce la tasa de errores por ambigüedad. RELEVANCIA: Conecta razonamiento simbólico con recuperación por embeddings, mejorando la precisión de sistemas RAG multimodales y la búsqueda en agentes con herramientas, un componente clave en pipelines agénticos modernos que deben discernir entre candidatos muy parecidos.

Transparencia: Este análisis ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies