watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
À chaud

Hugging Face intègre Nunchaku 4-bit et Baseten pour l'inférence de diffusion

jeudi 6 août 202600:002 min de lecture2 sources citées
L'essentiel — 3 points
  • 01Nunchaku 4-bit réduit la mémoire et accélère l'inférence des modèles de diffusion en exécutant les couches principales en W4A4 (poids et activations).
  • 02Les modèles Nunchaku sont désormais chargeables nativement via Diffusers avec `from_pretrained()`, sans compilation CUDA locale.
  • 03Baseten devient un fournisseur d'inférence intégré à Hugging Face, offrant une alternative scalable pour déployer les modèles quantifiés.
Hugging Face intègre Nunchaku 4-bit et Baseten pour l'inférence de diffusion

Hugging Face annonce l’intégration native de Nunchaku 4-bit dans sa bibliothèque Diffusers, permettant une inférence accélérée des modèles de diffusion avec une précision 4-bit pour les poids et les activations. L’entreprise ajoute également Baseten comme fournisseur d’inférence parmi ses options disponibles.

La solution Nunchaku 4-bit repose sur la méthode SVDQuant, qui réduit à la fois la mémoire et la latence en exécutant les couches principales du transformateur avec des poids et activations en 4-bit (W4A4). Contrairement aux méthodes de quantification weight-only (comme bitsandbytes ou GGUF), cette approche optimise directement le pipeline de débruitage, ce qui accélère l’inférence tout en limitant l’usage de mémoire. Jusqu’à présent, l’utilisation de ces modèles quantifiés nécessitait une bibliothèque d’inférence dédiée. Désormais, les utilisateurs peuvent charger un modèle Nunchaku directement via from_pretrained() dans Diffusers, sans compilation CUDA locale, grâce au package kernels. Le toolkit diffuse-compressor permet en outre de quantifier de nouvelles architectures et de publier les résultats sous forme de dépôts Diffusers classiques.

Pour utiliser Nunchaku 4-bit, il suffit d’installer les dépendances requises (diffusers, transformers, accelerate, kernels, bitsandbytes) et de charger un pipeline pré-quantifié comme tout autre modèle Diffusers. Par exemple, le modèle ERNIE-Image-Turbo-nunchaku-lite peut être instancié avec une simple ligne de code, en spécifiant un dtype bfloat16 et un périphérique CUDA. Les benchmarks indiquent une réduction de la latence et de l’empreinte mémoire par rapport aux versions non quantifiées, tout en maintenant la qualité des images générées.

Par ailleurs, Hugging Face intègre Baseten comme fournisseur d’inférence supplémentaire dans son écosystème. Les utilisateurs peuvent désormais déployer des modèles de diffusion via Baseten directement depuis les outils Hugging Face, élargissant les options de déploiement sans modifier leur code existant. Cette intégration simplifie l’accès à des infrastructures scalables pour l’exécution de modèles quantifiés ou non.

Les modèles Nunchaku 4-bit sont disponibles sous forme de checkpoints prêts à l’emploi sur le Hub Hugging Face, et le processus de quantification personnalisé est documenté pour les architectures non supportées par défaut.

Réagir :
Partager —XLinkedIn