watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Hugging Face permet de déployer un serveur vLLM en une seule commande

vendredi 26 juin 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Hugging Face permet de lancer un serveur vLLM privé en une seule commande sur son infrastructure, facturé à la seconde.
  • 02Le serveur expose une API compatible OpenAI accessible via curl ou le client OpenAI Python, authentifié par token Hugging Face.
  • 03Ce service cible les tests et évaluations rapides, distinct des Inference Endpoints réservés aux déploiements en production.
Hugging Face permet de déployer un serveur vLLM en une seule commande

Hugging Face propose désormais de lancer un serveur vLLM privé et compatible OpenAI sur son infrastructure via une commande unique, sans provisionner de serveurs ni gérer Kubernetes. Le service fonctionne en facturation à la seconde selon l'utilisation matérielle.

Le déploiement repose sur la commande hf jobs run, qui fonctionne comme docker run mais sur l'infrastructure Hugging Face. L'utilisateur spécifie le type de GPU avec --flavor (par exemple a10g-large), expose le port vLLM avec --expose 8000, et lance le conteneur officiel vllm/vllm-openai. Une fois exécutée, la commande retourne une URL publique permettant d'interroger le serveur depuis n'importe où. Le modèle télécharge ses poids et démarre en quelques minutes.

Le serveur expose une API compatible OpenAI. Les requêtes s'authentifient avec un token Hugging Face en bearer token. Depuis la ligne de commande, curl suffit pour envoyer des requêtes de chat. Depuis Python, le client OpenAI standard peut pointer directement sur l'URL exposée en utilisant le token comme clé API. Aucune configuration réseau supplémentaire n'est nécessaire.

Cette approche cible les tests, les évaluations et la génération par batch. Hugging Face distingue ce service de ses Inference Endpoints, présentés comme la solution pour les déploiements en production gérés. Les prérequis incluent une méthode de paiement ou un crédit prépayé, ainsi que huggingface_hub >= 1.20.0 et une authentification locale via hf auth login.

Réagir :
Partager —XLinkedIn
Sources citées