Ir al contenido principalSaltar al contenido
Hugging Face

Acelerando Qwen3.6 en Intel® Core™ Ultra Serie 3 con DFlash

Intel y Hugging Face han colaborado para acelerar el modelo de lenguaje Qwen3.6-35B-A3B en procesadores Intel® Core™ Ultra de la serie 3, utilizando la tecnología DFlash. DFlash es un método de decodificación especulativa que propone un bloque de tokens en paralelo, mejorando significativamente la velocidad de generación de texto. Los resultados muestran una aceleración de hasta 2.2x en HumanEval, 1.3x en MT-Bench y 1.6x en GSM8K para el modelo Qwen3.6-35B-A3B. Además, DFlash también acelera modelos densos como Qwen3.6-27B y Qwen3.5-9B, ofreciendo mayores ganancias de velocidad.

Qwen3.6Intel Core UltraDFlashmodelos de lenguajedecodificación especulativaMoEOpenVINO
Leer noticia original