watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion

jeudi 23 juillet 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Nunchaku 4-bit (W4A4) est désormais supporté nativement dans Diffusers via Hugging Face, réduisant la mémoire et accélérant l'inférence des modèles de diffusion.
  • 02Les modèles pré-quantifiés comme ERNIE-Image-Turbo sont disponibles sur le Hub et chargeables avec `from_pretrained()`.
  • 03L'outil diffuse-compressor permet de quantifier de nouvelles architectures et de publier les résultats en tant que dépôts Diffusers standard.
Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion

Hugging Face annonce la prise en charge native de l'inférence Nunchaku 4-bit dans sa bibliothèque Diffusers, permettant d'exécuter des modèles de diffusion avec des poids et activations quantifiés en 4 bits (W4A4).

Cette intégration s'appuie sur SVDQuant, une méthode de quantification développée par l'équipe derrière Nunchaku. Contrairement aux approches classiques de quantification (comme bitsandbytes ou GGUF), qui réduisent uniquement la précision des poids tout en conservant des activations en haute précision, SVDQuant applique une quantification 4-bit sur les poids et les activations (W4A4). Résultat : une réduction significative de la mémoire utilisée et une accélération du processus de débruitage (denoising loop), sans nécessiter de compilation locale des noyaux CUDA. Jusqu'à présent, l'utilisation de ces modèles quantifiés imposait une bibliothèque dédiée, Nunchaku. Désormais, les utilisateurs peuvent charger directement ces checkpoints via from_pretrained() dans Diffusers, comme pour tout autre modèle.

L'intégration inclut également un outil complémentaire, diffuse-compressor, qui permet de quantifier de nouvelles architectures et de publier les résultats sous forme de dépôts Diffusers standard. Les modèles pré-quantifiés sont disponibles sur le Hugging Face Hub, comme lite-infer/ERNIE-Image-Turbo-nunchaku-lite-nvfp4_r32-bnb4-text-encoder, et peuvent être utilisés avec une simple commande Python. La quantification W4A4 cible particulièrement les grands transformers de diffusion, dont l'exécution en précision BF16 nécessite souvent 20 à 30 Go de VRAM, rendant ces modèles inaccessibles sur la plupart des GPU grand public. Avec Nunchaku 4-bit, la mémoire requise est réduite, tout en maintenant une latence et une qualité d'image comparables aux versions non quantifiées.

Les benchmarks présentés dans l'annonce montrent une amélioration des performances en termes de latence globale et d'utilisation mémoire, bien que les métriques exactes ne soient pas détaillées. La compatibilité avec les GPU grand public (NVIDIA et AMD) est confirmée, sous réserve de disposer des noyaux optimisés fournis par le package kernels. Les utilisateurs peuvent également quantifier leurs propres modèles via diffuse-compressor, en suivant un processus en quatre étapes : inspection des couches à quantifier, exécution de la quantification, packaging du pipeline Diffusers, puis chargement et vérification du modèle.

Cette avancée simplifie l'adoption des modèles de diffusion quantifiés, en évitant les contraintes techniques liées aux bibliothèques externes et en offrant une intégration transparente avec l'écosystème Hugging Face.

Réagir :
Partager —XLinkedIn
Sources citées