Hugging Face Diffusers integra la inferencia por difusión de 4 bits de Nunchaku
Hugging Face ha integrado SVDQuant, el método de cuantificación de 4 bits de Nunchaku, en su biblioteca Diffusers, permitiendo la inferencia de modelos de difusión con menor consumo de memoria VRAM y mayor velocidad en hardware de consumo. Esta integración, denominada Nunchaku Lite, facilita la carga de checkpoints pre-cuantificados sin compilaciones locales y ofrece una reducción de hasta el 50% en VRAM y mejoras de latencia de hasta el 30%, que pueden incrementarse con `torch.compile`.
NunchakuDiffuserscuantificacióninferencia de 4 bitsSVDQuantmodelos de difusiónHugging Face
Leer noticia original