watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Hugging Face et vLLM unissent leurs backends pour des inférences plus rapides

mercredi 8 juillet 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Le backend vLLM est désormais intégré nativement dans la bibliothèque transformers de Hugging Face.
  • 02Les modèles Transformers s’exécutent avec un débit égal ou supérieur aux implémentations manuelles de vLLM, sans modification de code.
  • 03Les configurations de parallélisme (tensoriel, de données, d’experts) et le matériel restent identiques, simplifiant le déploiement.
Hugging Face et vLLM unissent leurs backends pour des inférences plus rapides

Hugging Face annonce l’intégration native du backend vLLM dans sa bibliothèque transformers, permettant d’exécuter des modèles Transformers avec des performances comparables, voire supérieures, à celles des implémentations manuelles de vLLM.

Cette intégration permet aux auteurs de modèles de déployer des architectures existantes dans vLLM sans modification, en utilisant simplement un drapeau (--model-impl transformers). Les gains de performance sont mesurés sur trois modèles Qwen3 de tailles variées : un modèle dense de 4 milliards de paramètres, un modèle dense de 32 milliards de paramètres avec parallélisme tensoriel, et un modèle Mixture-of-Experts de 235 milliards de paramètres (FP8) exploitant le parallélisme de données et d’experts. Dans chaque cas, le backend transformers atteint ou dépasse le débit natif de vLLM.

Le déploiement reste inchangé : les options de parallélisme (tensoriel, de données, d’experts) et les configurations matérielles sont conservées. Par exemple, un modèle Qwen3-4B s’exécute avec vllm serve Qwen/Qwen3-4B --model-impl transformers, tandis qu’un modèle de 235 milliards de paramètres utilise --data-parallel-size 8 --enable-expert-parallel. Les modèles utilisant une attention linéaire ne sont pas encore supportés, mais le seront prochainement. Les modèles personnalisés hébergés sur Hugging Face Hub peuvent ne pas fonctionner s’ils ne respectent pas les conventions de la bibliothèque transformers.

Cette avancée simplifie le passage à l’échelle des modèles sans réécriture, tout en bénéficiant des optimisations d’inférence de vLLM comme le continuous batching et les noyaux d’attention personnalisés.

Réagir :
Partager —XLinkedIn
Sources citées