watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Hugging Face et SkyPilot éliminent les frais de sortie de données pour les workloads IA multi-cloud

mardi 7 juillet 202621:152 min de lecture2 sources citées
L'essentiel — 3 points
  • 01Hugging Face Storage est maintenant un backend natif de SkyPilot, permettant de monter modèles et datasets via un schéma hf:// unique dans les jobs SkyPilot.
  • 02Hugging Face ne facture pas l'egress, donc lire les données sur des GPUs situés sur n'importe quel cloud ne coûte rien, éliminant la taxe de transfert multi-cloud.
  • 03Les Buckets utilisent Xet pour la déduplication, réduisant le stockage et le transfert aux seules portions modifiées des checkpoints et variantes de modèles.
Hugging Face et SkyPilot éliminent les frais de sortie de données pour les workloads IA multi-cloud

Hugging Face et SkyPilot ont intégré leurs plateformes pour permettre aux équipes d'exécuter des tâches IA sur n'importe quel cloud sans payer de frais de transfert de données. Hugging Face Storage devient un backend natif de SkyPilot, autorisant les utilisateurs à monter des modèles, datasets et buckets directement dans les jobs SkyPilot via un schéma hf:// unique, sans frais d'egress.

Le problème adressé est concret : les modèles et datasets résident généralement dans un bucket d'une région d'un cloud, tandis que les GPUs disponibles se trouvent ailleurs. Chaque lecture de données entre clouds entraîne des frais de transfert. Avec cette intégration, les données restent sur le Hub Hugging Face et SkyPilot orchestre le calcul sur le cluster offrant la meilleure capacité GPU, quel que soit le fournisseur cloud. Puisque Hugging Face ne facture pas l'egress, lire les données sur ces GPUs ne coûte rien.

Techniquement, l'intégration fonctionne par montage FUSE : un utilisateur spécifie dans sa configuration SkyPilot une source hf://buckets/org/nom ou hf://modèle/dataset avec un token HF existant, puis lance le job. SkyPilot cherche les GPUs disponibles parmi 20+ clouds, Kubernetes, Slurm et infrastructure on-prem. Les données sont lues directement du bucket Hugging Face, sans copies par cloud ni facture d'egress. Les Buckets Hugging Face reposent sur Xet, une technologie de déduplication qui limite le stockage et le transfert aux chunks modifiés, utile pour les checkpoints et variantes de modèles.

L'implémentation a nécessité des contributions en amont : l'équipe Hugging Face a corrigé des problèmes FUSE pour fonctionner dans des conteneurs sans privilèges. Le schéma hf:// couvre le cycle complet : lire le modèle et dataset depuis leurs repos, écrire les checkpoints dans un Bucket pendant l'entraînement, publier le modèle fini et le récupérer ensuite.

Réagir :
Partager —XLinkedIn