Nunchaku Lite : inférence diffusion 4-bit intégrée à Diffusers

26 juillet 2026 · IA · NVDA

Hugging Face intègre nativement Nunchaku Lite dans Diffusers, permettant de charger des modèles de diffusion quantifiés en 4 bits (W4A4) sans compilation locale ni moteur d'inférence séparé. La méthode SVDQuant réduit la VRAM de 50% (31 GB → 16 GB) tout en accélérant l'inférence de 30 à 80% selon la configuration. Les GPU NVIDIA Blackwell (RTX 50 series) bénéficient des kernels NVFP4, tandis que les générations précédentes utilisent des variantes INT4. Un toolkit diffuse-compressor permet également de quantifier ses propres architectures.

Source originale