Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion
- 01Nunchaku 4-bit (W4A4) est désormais supporté nativement dans Diffusers via Hugging Face, réduisant la mémoire et accélérant l'inférence des modèles de diffusion.
- 02Les modèles pré-quantifiés comme ERNIE-Image-Turbo sont disponibles sur le Hub et chargeables avec `from_pretrained()`.
- 03L'outil diffuse-compressor permet de quantifier de nouvelles architectures et de publier les résultats en tant que dépôts Diffusers standard.
Hugging Face annonce la prise en charge native de l'inférence Nunchaku 4-bit dans sa bibliothèque Diffusers, permettant d'exécuter des modèles de diffusion avec des poids et activations quantifiés en 4 bits (W4A4).
Cette intégration s'appuie sur SVDQuant, une méthode de quantification développée par l'équipe derrière Nunchaku. Contrairement aux approches classiques de quantification (comme bitsandbytes ou GGUF), qui réduisent uniquement la précision des poids tout en conservant des activations en haute précision, SVDQuant applique une quantification 4-bit sur les poids et les activations (W4A4). Résultat : une réduction significative de la mémoire utilisée et une accélération du processus de débruitage (denoising loop), sans nécessiter de compilation locale des noyaux CUDA. Jusqu'à présent, l'utilisation de ces modèles quantifiés imposait une bibliothèque dédiée, Nunchaku. Désormais, les utilisateurs peuvent charger directement ces checkpoints via from_pretrained() dans Diffusers, comme pour tout autre modèle.
L'intégration inclut également un outil complémentaire, diffuse-compressor, qui permet de quantifier de nouvelles architectures et de publier les résultats sous forme de dépôts Diffusers standard. Les modèles pré-quantifiés sont disponibles sur le Hugging Face Hub, comme lite-infer/ERNIE-Image-Turbo-nunchaku-lite-nvfp4_r32-bnb4-text-encoder, et peuvent être utilisés avec une simple commande Python. La quantification W4A4 cible particulièrement les grands transformers de diffusion, dont l'exécution en précision BF16 nécessite souvent 20 à 30 Go de VRAM, rendant ces modèles inaccessibles sur la plupart des GPU grand public. Avec Nunchaku 4-bit, la mémoire requise est réduite, tout en maintenant une latence et une qualité d'image comparables aux versions non quantifiées.
Les benchmarks présentés dans l'annonce montrent une amélioration des performances en termes de latence globale et d'utilisation mémoire, bien que les métriques exactes ne soient pas détaillées. La compatibilité avec les GPU grand public (NVIDIA et AMD) est confirmée, sous réserve de disposer des noyaux optimisés fournis par le package kernels. Les utilisateurs peuvent également quantifier leurs propres modèles via diffuse-compressor, en suivant un processus en quatre étapes : inspection des couches à quantifier, exécution de la quantification, packaging du pipeline Diffusers, puis chargement et vérification du modèle.
Cette avancée simplifie l'adoption des modèles de diffusion quantifiés, en évitant les contraintes techniques liées aux bibliothèques externes et en offrant une intégration transparente avec l'écosystème Hugging Face.
Articles liés

NeoMME : un encodeur multimodal multilingue open source sans tour de vision séparée
Explorer une innovation open-source majeure pour les modèles d'IA polyvalents.
Hugging Face publie un guide pour affiner des modèles en 100 étapes avec GRPO
Découvrez une méthode de fine-tuning optimisée pour générer des sorties structurées avec des modèles de taille réduite.
Hugging Face publie plus de 200 kernels WebGPU pour accélérer l'IA locale dans le navigateur
Découvrez comment optimiser vos modèles d'IA locaux avec les nouveaux kernels WebGPU de Hugging Face.