Hugging Face integra la inferencia de difusión Nunchaku de 4 bits en Diffusers
Hugging Face ha integrado la inferencia de difusión Nunchaku de 4 bits en su biblioteca Diffusers, permitiendo el uso de modelos de difusión de gran tamaño con un menor consumo de VRAM y mayor velocidad. La técnica de cuantificación SVDQuant de Nunchaku utiliza pesos y activaciones de 4 bits para reducir la memoria y acelerar el proceso de denoising. Nunchaku Lite, la nueva ruta de integración, permite cargar estos checkpoints sin necesidad de compilación CUDA local, ofreciendo una reducción de VRAM de hasta el 50% y una mejora de la latencia del 30%.
NunchakuDiffuserscuantificacióninferencia de difusiónSVDQuantmodelos de lenguajeIA
Leer noticia original