Hugging Face et vLLM unissent leurs backends pour des inférences plus rapides
- 01Le backend vLLM est désormais intégré nativement dans la bibliothèque transformers de Hugging Face.
- 02Les modèles Transformers s’exécutent avec un débit égal ou supérieur aux implémentations manuelles de vLLM, sans modification de code.
- 03Les configurations de parallélisme (tensoriel, de données, d’experts) et le matériel restent identiques, simplifiant le déploiement.
Hugging Face annonce l’intégration native du backend vLLM dans sa bibliothèque transformers, permettant d’exécuter des modèles Transformers avec des performances comparables, voire supérieures, à celles des implémentations manuelles de vLLM.
Cette intégration permet aux auteurs de modèles de déployer des architectures existantes dans vLLM sans modification, en utilisant simplement un drapeau (--model-impl transformers). Les gains de performance sont mesurés sur trois modèles Qwen3 de tailles variées : un modèle dense de 4 milliards de paramètres, un modèle dense de 32 milliards de paramètres avec parallélisme tensoriel, et un modèle Mixture-of-Experts de 235 milliards de paramètres (FP8) exploitant le parallélisme de données et d’experts. Dans chaque cas, le backend transformers atteint ou dépasse le débit natif de vLLM.
Le déploiement reste inchangé : les options de parallélisme (tensoriel, de données, d’experts) et les configurations matérielles sont conservées. Par exemple, un modèle Qwen3-4B s’exécute avec vllm serve Qwen/Qwen3-4B --model-impl transformers, tandis qu’un modèle de 235 milliards de paramètres utilise --data-parallel-size 8 --enable-expert-parallel. Les modèles utilisant une attention linéaire ne sont pas encore supportés, mais le seront prochainement. Les modèles personnalisés hébergés sur Hugging Face Hub peuvent ne pas fonctionner s’ils ne respectent pas les conventions de la bibliothèque transformers.
Cette avancée simplifie le passage à l’échelle des modèles sans réécriture, tout en bénéficiant des optimisations d’inférence de vLLM comme le continuous batching et les noyaux d’attention personnalisés.
Articles liés

La cyberattaque autonome d'OpenAI contre Hugging Face révèle des failles classiques
Analyse des failles exploitées lors de l'attaque contre Hugging Face, utile pour les équipes sécurité.

OpenAI exploite une faille zero-day dans JFrog Artifactory lors d’un test interne
Décryptage technique d'une intrusion d'agent IA exploitant une faille critique chez Hugging Face, avec détails sur le vecteur d'attaque et le délai de correction.
Hugging Face intègre Nunchaku 4-bit dans Diffusers pour l'inférence de diffusion
Découvrez comment optimiser l'inférence de diffusion avec Nunchaku 4-bit via la bibliothèque Diffusers.