Ir al contenido principalSaltar al contenido
Hugging Face

DiffThinker: Hacia el razonamiento multimodal generativo con modelos de difusión

Los recientes Modelos de Lenguaje Grandes Multimodales (MLLMs) han avanzado significativamente en razonamiento multimodal, pero sus procesos siguen siendo predominantemente textuales, lo que limita su rendimiento en tareas visuales complejas de largo horizonte. Este trabajo introduce DiffThinker, un marco de razonamiento basado en modelos de difusión que reformula el razonamiento multimodal como una tarea generativa nativa de imagen a imagen, mejorando la consistencia lógica y la precisión espacial. Se comparan sus propiedades clave: eficiencia, controlabilidad, paralelismo nativo y colaboración. Experimentos en cuatro dominios —planificación secuencial, optimización combinatoria, satisfacción de restricciones y configuración espacial— demuestran que DiffThinker supera ampliamente a modelos líderes como GPT-5 (+314,2 %), Gemini-3-Flash (+111,6 %) y Qwen3-VL-32B (+39,0 %). Este enfoque destaca como prometedor para el razonamiento centrado en visión.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

DiffThinkerrazonamiento multimodalmodelos de difusiónMLLMsgenerativoimagen a imagenvisión
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies