Qwen3.5: Nadie coincide en el mecanismo de atención
El equipo de Qwen de Alibaba ha lanzado Qwen3.5-397B-A17B, un modelo Mixture-of-Experts de 397 mil millones de parámetros con solo 17 mil millones activos por token. Destaca por su arquitectura de atención híbrida que alterna capas de Gated DeltaNet (atención lineal) y atención completa en proporción 3:1, permitiendo eficiencia en contextos largos de hasta 1 millón de tokens. El modelo es nativamente multimodal, soporta 201 idiomas y brilla en benchmarks de razonamiento, seguimiento de instrucciones, visión y tareas agenticas, superando a modelos como GPT-5.2 y Claude en varias categorías. Este lanzamiento refleja la divergencia en mecanismos de atención entre laboratorios chinos recientes como GLM-5 y MiniMax M2.5, posicionando la atención como el nuevo campo de batalla en IA.
Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.