DiffThinker: Hacia el razonamiento multimodal generativo con modelos de difusión
Los recientes Modelos de Lenguaje Grandes Multimodales (MLLMs) han avanzado significativamente en razonamiento multimodal, pero sus procesos siguen siendo predominantemente textuales, lo que limita su rendimiento en tareas visuales complejas de largo horizonte. Este trabajo introduce DiffThinker, un marco de razonamiento basado en modelos de difusión que reformula el razonamiento multimodal como una tarea generativa nativa de imagen a imagen, mejorando la consistencia lógica y la precisión espacial. Se comparan sus propiedades clave: eficiencia, controlabilidad, paralelismo nativo y colaboración. Experimentos en cuatro dominios —planificación secuencial, optimización combinatoria, satisfacción de restricciones y configuración espacial— demuestran que DiffThinker supera ampliamente a modelos líderes como GPT-5 (+314,2 %), Gemini-3-Flash (+111,6 %) y Qwen3-VL-32B (+39,0 %). Este enfoque destaca como prometedor para el razonamiento centrado en visión.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.