watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Hugging Face rend vLLM aussi rapide que les implémentations natives avec son backend transformers

mercredi 8 juillet 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Hugging Face a optimisé son backend transformers dans vLLM pour égaler ou surpasser les implémentations natives en vitesse d'inférence.
  • 02Les développeurs peuvent servir n'importe quel modèle Hugging Face via vLLM avec un simple flag `--model-impl transformers`, sans refonte du code.
  • 03Les tests sur trois architectures Qwen3 (4B, 32B, 235B MoE) confirment que le backend transformers atteint la parité de performance avec les implémentations natives.
Hugging Face rend vLLM aussi rapide que les implémentations natives avec son backend transformers

Hugging Face a intégré vLLM comme backend natif pour ses modèles, permettant aux développeurs d'exécuter des modèles de la plateforme directement dans vLLM sans perte de performance. Cette intégration, annoncée le 8 juillet 2026, signifie que les implémentations transformers atteignent désormais une vitesse égale ou supérieure aux implémentations natives de vLLM pour de nombreuses architectures.

La transformers library est devenue la référence pour la modélisation en machine learning, supportant plus de 450 architectures via des APIs cohérentes. Jusqu'à présent, les modèles devaient être portés manuellement vers vLLM pour bénéficier de ses optimisations d'inférence (batching continu, kernels d'attention personnalisés). Avec ce nouveau backend, les auteurs de modèles peuvent automatiquement exploiter les implémentations transformers pour obtenir une inférence ultra-rapide sans travail supplémentaire.

Hugging Face a testé le backend transformers de vLLM contre les implémentations natives sur trois modèles Qwen3 très différents : un modèle dense 4B sur GPU unique, un 32B dense avec parallélisme tensoriel, et un mélange d'experts 235B-paramètre FP8 avec parallélisme données et experts sur 8 GPUs H100. Le résultat montre que le backend transformers égale ou surpasse le débit natif dans tous les cas. L'activation du backend ne demande qu'un seul flag — --model-impl transformers — et se compose avec les options de parallélisme existantes, sans modification de l'infrastructure de déploiement.

La mise à jour nécessite d'upgrader le paquet vllm via pip. Une limitation actuelle concerne les modèles utilisant l'attention linéaire, non encore supportés mais prévus dans les versions futures. Les modèles personnalisés dont le code réside dans un repo Hub risquent de ne pas fonctionner s'ils n'ont pas été écrits en conformité avec les standards.

Réagir :
Partager —XLinkedIn
Sources citées