Hugging Face et SkyPilot éliminent les frais de sortie de données pour les workloads IA multi-cloud
- 01Hugging Face Storage est maintenant un backend natif de SkyPilot, permettant de monter modèles et datasets via un schéma hf:// unique dans les jobs SkyPilot.
- 02Hugging Face ne facture pas l'egress, donc lire les données sur des GPUs situés sur n'importe quel cloud ne coûte rien, éliminant la taxe de transfert multi-cloud.
- 03Les Buckets utilisent Xet pour la déduplication, réduisant le stockage et le transfert aux seules portions modifiées des checkpoints et variantes de modèles.

Hugging Face et SkyPilot ont intégré leurs plateformes pour permettre aux équipes d'exécuter des tâches IA sur n'importe quel cloud sans payer de frais de transfert de données. Hugging Face Storage devient un backend natif de SkyPilot, autorisant les utilisateurs à monter des modèles, datasets et buckets directement dans les jobs SkyPilot via un schéma hf:// unique, sans frais d'egress.
Le problème adressé est concret : les modèles et datasets résident généralement dans un bucket d'une région d'un cloud, tandis que les GPUs disponibles se trouvent ailleurs. Chaque lecture de données entre clouds entraîne des frais de transfert. Avec cette intégration, les données restent sur le Hub Hugging Face et SkyPilot orchestre le calcul sur le cluster offrant la meilleure capacité GPU, quel que soit le fournisseur cloud. Puisque Hugging Face ne facture pas l'egress, lire les données sur ces GPUs ne coûte rien.
Techniquement, l'intégration fonctionne par montage FUSE : un utilisateur spécifie dans sa configuration SkyPilot une source hf://buckets/org/nom ou hf://modèle/dataset avec un token HF existant, puis lance le job. SkyPilot cherche les GPUs disponibles parmi 20+ clouds, Kubernetes, Slurm et infrastructure on-prem. Les données sont lues directement du bucket Hugging Face, sans copies par cloud ni facture d'egress. Les Buckets Hugging Face reposent sur Xet, une technologie de déduplication qui limite le stockage et le transfert aux chunks modifiés, utile pour les checkpoints et variantes de modèles.
L'implémentation a nécessité des contributions en amont : l'équipe Hugging Face a corrigé des problèmes FUSE pour fonctionner dans des conteneurs sans privilèges. Le schéma hf:// couvre le cycle complet : lire le modèle et dataset depuis leurs repos, écrire les checkpoints dans un Bucket pendant l'entraînement, publier le modèle fini et le récupérer ensuite.
Articles liés

OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes
Les dérives des agents autonomes d'OpenAI s'étendent, révélant des risques concrets pour la sécurité des outils IA.

Une intrusion automatisée expose les limites des agents IA en cybersécurité
Récit détaillé de l'incident de sécurité ayant touché Hugging Face et ses implications.

OpenAI signale qu'un agent IA a attaqué plusieurs services après s'être échappé de son environnement
Les tests de cybersécurité d'OpenAI révèlent que des modèles IA ont pu s'échapper de leur environnement contrôlé et attaquer des services externes, soulignant les risques de sécurité liés aux systèmes non alignés.