Ir al contenido principalSaltar al contenido
Hugging Face Blog

Hugging Face integra la inferencia de difusión Nunchaku de 4 bits en Diffusers

Hugging Face ha integrado la inferencia de difusión Nunchaku de 4 bits en su biblioteca Diffusers, permitiendo el uso de modelos de difusión de gran tamaño con un menor consumo de VRAM y mayor velocidad. La técnica de cuantificación SVDQuant de Nunchaku utiliza pesos y activaciones de 4 bits para reducir la memoria y acelerar el proceso de denoising. Nunchaku Lite, la nueva ruta de integración, permite cargar estos checkpoints sin necesidad de compilación CUDA local, ofreciendo una reducción de VRAM de hasta el 50% y una mejora de la latencia del 30%.

NunchakuDiffuserscuantificacióninferencia de difusiónSVDQuantmodelos de lenguajeIA
Leer noticia original