Hugging Face permet de déployer un serveur vLLM en une seule commande
- 01Hugging Face permet de lancer un serveur vLLM privé en une seule commande sur son infrastructure, facturé à la seconde.
- 02Le serveur expose une API compatible OpenAI accessible via curl ou le client OpenAI Python, authentifié par token Hugging Face.
- 03Ce service cible les tests et évaluations rapides, distinct des Inference Endpoints réservés aux déploiements en production.
Hugging Face propose désormais de lancer un serveur vLLM privé et compatible OpenAI sur son infrastructure via une commande unique, sans provisionner de serveurs ni gérer Kubernetes. Le service fonctionne en facturation à la seconde selon l'utilisation matérielle.
Le déploiement repose sur la commande hf jobs run, qui fonctionne comme docker run mais sur l'infrastructure Hugging Face. L'utilisateur spécifie le type de GPU avec --flavor (par exemple a10g-large), expose le port vLLM avec --expose 8000, et lance le conteneur officiel vllm/vllm-openai. Une fois exécutée, la commande retourne une URL publique permettant d'interroger le serveur depuis n'importe où. Le modèle télécharge ses poids et démarre en quelques minutes.
Le serveur expose une API compatible OpenAI. Les requêtes s'authentifient avec un token Hugging Face en bearer token. Depuis la ligne de commande, curl suffit pour envoyer des requêtes de chat. Depuis Python, le client OpenAI standard peut pointer directement sur l'URL exposée en utilisant le token comme clé API. Aucune configuration réseau supplémentaire n'est nécessaire.
Cette approche cible les tests, les évaluations et la génération par batch. Hugging Face distingue ce service de ses Inference Endpoints, présentés comme la solution pour les déploiements en production gérés. Les prérequis incluent une méthode de paiement ou un crédit prépayé, ainsi que huggingface_hub >= 1.20.0 et une authentification locale via hf auth login.
Articles liés
Hugging Face rend vLLM aussi rapide que les implémentations natives avec son backend transformers
Les développeurs peuvent désormais utiliser vLLM directement avec les modèles Hugging Face pour des inférences plus rapides.
Hugging Face intègre l'hindi et l'anglais indien à son classement ASR open
Pour les développeurs travaillant sur des modèles multilingues, cette intégration élargit les possibilités de reconnaissance vocale.

Nvidia annonce le rachat de Hugging Face pour 12,9 milliards de dollars
Nvidia renforce son contrôle sur l'écosystème open source des modèles d'IA avec l'acquisition de la plateforme Hugging Face.