watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Hugging Face et vLLM unissent leurs backends pour des inférences plus rapides

mercredi 8 juillet 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Le backend vLLM est désormais intégré nativement dans la bibliothèque transformers de Hugging Face.
  • 02Les modèles Transformers s’exécutent avec un débit égal ou supérieur aux implémentations manuelles de vLLM, sans modification de code.
  • 03Les configurations de parallélisme (tensoriel, de données, d’experts) et le matériel restent identiques, simplifiant le déploiement.
Hugging Face et vLLM unissent leurs backends pour des inférences plus rapides

Hugging Face annonce l’intégration native du backend vLLM dans sa bibliothèque transformers, permettant d’exécuter des modèles Transformers avec des performances comparables, voire supérieures, à celles des implémentations manuelles de vLLM.

Cette intégration permet aux auteurs de modèles de déployer des architectures existantes dans vLLM sans modification, en utilisant simplement un drapeau (--model-impl transformers). Les gains de performance sont mesurés sur trois modèles Qwen3 de tailles variées : un modèle dense de 4 milliards de paramètres, un modèle dense de 32 milliards de paramètres avec parallélisme tensoriel, et un modèle Mixture-of-Experts de 235 milliards de paramètres (FP8) exploitant le parallélisme de données et d’experts. Dans chaque cas, le backend transformers atteint ou dépasse le débit natif de vLLM.

Le déploiement reste inchangé : les options de parallélisme (tensoriel, de données, d’experts) et les configurations matérielles sont conservées. Par exemple, un modèle Qwen3-4B s’exécute avec vllm serve Qwen/Qwen3-4B --model-impl transformers, tandis qu’un modèle de 235 milliards de paramètres utilise --data-parallel-size 8 --enable-expert-parallel. Les modèles utilisant une attention linéaire ne sont pas encore supportés, mais le seront prochainement. Les modèles personnalisés hébergés sur Hugging Face Hub peuvent ne pas fonctionner s’ils ne respectent pas les conventions de la bibliothèque transformers.

Cette avancée simplifie le passage à l’échelle des modèles sans réécriture, tout en bénéficiant des optimisations d’inférence de vLLM comme le continuous batching et les noyaux d’attention personnalisés.

Réagir :
Partager —XLinkedIn
Sources citées