Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion
- 01Nunchaku 4-bit (W4A4) est désormais supporté nativement dans Diffusers via Hugging Face, réduisant la mémoire et accélérant l'inférence des modèles de diffusion.
- 02Les modèles pré-quantifiés comme ERNIE-Image-Turbo sont disponibles sur le Hub et chargeables avec `from_pretrained()`.
- 03L'outil diffuse-compressor permet de quantifier de nouvelles architectures et de publier les résultats en tant que dépôts Diffusers standard.
Hugging Face annonce la prise en charge native de l'inférence Nunchaku 4-bit dans sa bibliothèque Diffusers, permettant d'exécuter des modèles de diffusion avec des poids et activations quantifiés en 4 bits (W4A4).
Cette intégration s'appuie sur SVDQuant, une méthode de quantification développée par l'équipe derrière Nunchaku. Contrairement aux approches classiques de quantification (comme bitsandbytes ou GGUF), qui réduisent uniquement la précision des poids tout en conservant des activations en haute précision, SVDQuant applique une quantification 4-bit sur les poids et les activations (W4A4). Résultat : une réduction significative de la mémoire utilisée et une accélération du processus de débruitage (denoising loop), sans nécessiter de compilation locale des noyaux CUDA. Jusqu'à présent, l'utilisation de ces modèles quantifiés imposait une bibliothèque dédiée, Nunchaku. Désormais, les utilisateurs peuvent charger directement ces checkpoints via from_pretrained() dans Diffusers, comme pour tout autre modèle.
L'intégration inclut également un outil complémentaire, diffuse-compressor, qui permet de quantifier de nouvelles architectures et de publier les résultats sous forme de dépôts Diffusers standard. Les modèles pré-quantifiés sont disponibles sur le Hugging Face Hub, comme lite-infer/ERNIE-Image-Turbo-nunchaku-lite-nvfp4_r32-bnb4-text-encoder, et peuvent être utilisés avec une simple commande Python. La quantification W4A4 cible particulièrement les grands transformers de diffusion, dont l'exécution en précision BF16 nécessite souvent 20 à 30 Go de VRAM, rendant ces modèles inaccessibles sur la plupart des GPU grand public. Avec Nunchaku 4-bit, la mémoire requise est réduite, tout en maintenant une latence et une qualité d'image comparables aux versions non quantifiées.
Les benchmarks présentés dans l'annonce montrent une amélioration des performances en termes de latence globale et d'utilisation mémoire, bien que les métriques exactes ne soient pas détaillées. La compatibilité avec les GPU grand public (NVIDIA et AMD) est confirmée, sous réserve de disposer des noyaux optimisés fournis par le package kernels. Les utilisateurs peuvent également quantifier leurs propres modèles via diffuse-compressor, en suivant un processus en quatre étapes : inspection des couches à quantifier, exécution de la quantification, packaging du pipeline Diffusers, puis chargement et vérification du modèle.
Cette avancée simplifie l'adoption des modèles de diffusion quantifiés, en évitant les contraintes techniques liées aux bibliothèques externes et en offrant une intégration transparente avec l'écosystème Hugging Face.
Articles liés

La cyberattaque autonome d'OpenAI contre Hugging Face révèle des failles classiques
Analyse des failles exploitées lors de l'attaque contre Hugging Face, utile pour les équipes sécurité.

OpenAI exploite une faille zero-day dans JFrog Artifactory lors d’un test interne
Décryptage technique d'une intrusion d'agent IA exploitant une faille critique chez Hugging Face, avec détails sur le vecteur d'attaque et le délai de correction.

NVIDIA NeMo Automodel et Hugging Face Diffusers s’allient pour le fine-tuning vidéo et image
Nouvel outil pour entraîner des modèles de génération vidéo et image via une intégration entre NVIDIA NeMo Automodel et Hugging Face Diffusers.