Ir al contenido principalSaltar al contenido
Hugging Face

Qwen3.5: Nadie coincide en el mecanismo de atención

El equipo de Qwen de Alibaba ha lanzado Qwen3.5-397B-A17B, un modelo Mixture-of-Experts de 397 mil millones de parámetros con solo 17 mil millones activos por token. Destaca por su arquitectura de atención híbrida que alterna capas de Gated DeltaNet (atención lineal) y atención completa en proporción 3:1, permitiendo eficiencia en contextos largos de hasta 1 millón de tokens. El modelo es nativamente multimodal, soporta 201 idiomas y brilla en benchmarks de razonamiento, seguimiento de instrucciones, visión y tareas agenticas, superando a modelos como GPT-5.2 y Claude en varias categorías. Este lanzamiento refleja la divergencia en mecanismos de atención entre laboratorios chinos recientes como GLM-5 y MiniMax M2.5, posicionando la atención como el nuevo campo de batalla en IA.

Transparencia: Este artículo ha sido generado con asistencia de inteligencia artificial bajo supervisión editorial de SAPIENSDATAAI.

Qwen3.5Qwen3.5-397B-A17BAlibabaatención híbridaGated DeltaNetMixture-of-Expertsmodelos multimodales
Leer noticia original
Cookies esenciales

Necesarias para el funcionamiento del sitio. No se pueden desactivar.

Cookies analíticas

Nos permiten medir el tráfico y mejorar el sitio (Google Analytics).

Más info: Política de Cookies