watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion

jeudi 23 juillet 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Nunchaku 4-bit (W4A4) est désormais supporté nativement dans Diffusers via Hugging Face, réduisant la mémoire et accélérant l'inférence des modèles de diffusion.
  • 02Les modèles pré-quantifiés comme ERNIE-Image-Turbo sont disponibles sur le Hub et chargeables avec `from_pretrained()`.
  • 03L'outil diffuse-compressor permet de quantifier de nouvelles architectures et de publier les résultats en tant que dépôts Diffusers standard.
Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion

Hugging Face annonce la prise en charge native de l'inférence Nunchaku 4-bit dans sa bibliothèque Diffusers, permettant d'exécuter des modèles de diffusion avec des poids et activations quantifiés en 4 bits (W4A4).

Cette intégration s'appuie sur SVDQuant, une méthode de quantification développée par l'équipe derrière Nunchaku. Contrairement aux approches classiques de quantification (comme bitsandbytes ou GGUF), qui réduisent uniquement la précision des poids tout en conservant des activations en haute précision, SVDQuant applique une quantification 4-bit sur les poids et les activations (W4A4). Résultat : une réduction significative de la mémoire utilisée et une accélération du processus de débruitage (denoising loop), sans nécessiter de compilation locale des noyaux CUDA. Jusqu'à présent, l'utilisation de ces modèles quantifiés imposait une bibliothèque dédiée, Nunchaku. Désormais, les utilisateurs peuvent charger directement ces checkpoints via from_pretrained() dans Diffusers, comme pour tout autre modèle.

L'intégration inclut également un outil complémentaire, diffuse-compressor, qui permet de quantifier de nouvelles architectures et de publier les résultats sous forme de dépôts Diffusers standard. Les modèles pré-quantifiés sont disponibles sur le Hugging Face Hub, comme lite-infer/ERNIE-Image-Turbo-nunchaku-lite-nvfp4_r32-bnb4-text-encoder, et peuvent être utilisés avec une simple commande Python. La quantification W4A4 cible particulièrement les grands transformers de diffusion, dont l'exécution en précision BF16 nécessite souvent 20 à 30 Go de VRAM, rendant ces modèles inaccessibles sur la plupart des GPU grand public. Avec Nunchaku 4-bit, la mémoire requise est réduite, tout en maintenant une latence et une qualité d'image comparables aux versions non quantifiées.

Les benchmarks présentés dans l'annonce montrent une amélioration des performances en termes de latence globale et d'utilisation mémoire, bien que les métriques exactes ne soient pas détaillées. La compatibilité avec les GPU grand public (NVIDIA et AMD) est confirmée, sous réserve de disposer des noyaux optimisés fournis par le package kernels. Les utilisateurs peuvent également quantifier leurs propres modèles via diffuse-compressor, en suivant un processus en quatre étapes : inspection des couches à quantifier, exécution de la quantification, packaging du pipeline Diffusers, puis chargement et vérification du modèle.

Cette avancée simplifie l'adoption des modèles de diffusion quantifiés, en évitant les contraintes techniques liées aux bibliothèques externes et en offrant une intégration transparente avec l'écosystème Hugging Face.

Réagir :
Partager —XLinkedIn
Sources citées