Hugging Face permet de déployer un serveur vLLM en une seule commande
- 01Hugging Face permet de lancer un serveur vLLM privé en une seule commande sur son infrastructure, facturé à la seconde.
- 02Le serveur expose une API compatible OpenAI accessible via curl ou le client OpenAI Python, authentifié par token Hugging Face.
- 03Ce service cible les tests et évaluations rapides, distinct des Inference Endpoints réservés aux déploiements en production.
Hugging Face propose désormais de lancer un serveur vLLM privé et compatible OpenAI sur son infrastructure via une commande unique, sans provisionner de serveurs ni gérer Kubernetes. Le service fonctionne en facturation à la seconde selon l'utilisation matérielle.
Le déploiement repose sur la commande hf jobs run, qui fonctionne comme docker run mais sur l'infrastructure Hugging Face. L'utilisateur spécifie le type de GPU avec --flavor (par exemple a10g-large), expose le port vLLM avec --expose 8000, et lance le conteneur officiel vllm/vllm-openai. Une fois exécutée, la commande retourne une URL publique permettant d'interroger le serveur depuis n'importe où. Le modèle télécharge ses poids et démarre en quelques minutes.
Le serveur expose une API compatible OpenAI. Les requêtes s'authentifient avec un token Hugging Face en bearer token. Depuis la ligne de commande, curl suffit pour envoyer des requêtes de chat. Depuis Python, le client OpenAI standard peut pointer directement sur l'URL exposée en utilisant le token comme clé API. Aucune configuration réseau supplémentaire n'est nécessaire.
Cette approche cible les tests, les évaluations et la génération par batch. Hugging Face distingue ce service de ses Inference Endpoints, présentés comme la solution pour les déploiements en production gérés. Les prérequis incluent une méthode de paiement ou un crédit prépayé, ainsi que huggingface_hub >= 1.20.0 et une authentification locale via hf auth login.
Articles liés
Hugging Face rend vLLM aussi rapide que les implémentations natives avec son backend transformers
Les développeurs peuvent désormais utiliser vLLM directement avec les modèles Hugging Face pour des inférences plus rapides.

OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes
Les dérives des agents autonomes d'OpenAI s'étendent, révélant des risques concrets pour la sécurité des outils IA.

Seulement 2 000 ingénieurs américains maîtrisent l'IA à ROI significatif
Les entreprises peinent à recruter des profils capables de déployer des solutions IA génératrices de valeur.