watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·29 aoûtSony Music et Warner Chappell attaquent Anthropic pour violation de droits d'auteur·29 aoûtVijay Pande quitte a16z pour fonder VZVC, une structure ciblée en IA médicale·29 aoûtNvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données·29 aoûtLes musiciens traquent l'utilisation non déclarée d'œuvres pour l'IA générative musicale·28 aoûtNeocloud Lambda lève 1 milliard de dollars de dette pour financer des puces Nvidia·28 aoûtAnthropic démontre l’auto-amélioration contrôlée d’une IA par un système automatisé·28 aoûtLes acquisitions ciblent les acteurs de l’IA open source pour contrôler les modèles·28 aoûtUn juge fédéral annule le blacklistage d'Anthropic par l'administration Trump·28 aoûtL’EPA américaine supprime l’obligation de consultation publique pour les permis de pollution des data centers·28 aoûtMicroduck, un robot humanoïde open source de 25 cm à 399 $·

Hugging Face et Dharma AI augmentent l'utilisation des GPU de 33 points avec un ordonnanceur contraint

lundi 17 août 202619:462 min de lecture1 source citée
L'essentiel — 3 points
  • 01Un allocateur contraint améliore l'utilisation des GPU de 33 points de pourcentage par rapport à un ordonnanceur FIFO dans des benchmarks comparables.
  • 02L'inférence en temps réel et les workloads batch (entraînement, inférence par lots, quantification) entrent en contention sur les mêmes ressources, que le FIFO ne gère pas efficacement.
  • 03Les gains proviennent uniquement de l'ordre des décisions d'allocation, sans modification matérielle ni changement de workload.
Hugging Face et Dharma AI augmentent l'utilisation des GPU de 33 points avec un ordonnanceur contraint

Hugging Face et Dharma AI annoncent une hausse de 33 points de pourcentage de l’utilisation des GPU dans des scénarios de benchmark comparables, en remplaçant un ordonnanceur FIFO par un allocateur contraint par les priorités et les contraintes matérielles.

L’expérience, menée sur des hardwares identiques et des workloads identiques, compare un ordonnanceur FIFO à un allocateur contraint sur sept scénarios de benchmark. Les résultats montrent une augmentation de l’utilisation des GPU jusqu’à 33 points de pourcentage, ainsi qu’une hausse de 105 % de la production pondérée par la priorité dans tous les scénarios testés. Aucun changement matériel n’a été apporté : seule l’ordre des décisions d’allocation a été modifié. Les gains sont exprimés en amélioration par rapport aux résultats obtenus avec l’ordonnanceur FIFO sur chaque scénario.

L’ordonnanceur FIFO réserve une capacité fixe pour l’inférence en temps réel et place les autres jobs dans l’ordre d’arrivée, sans tenir compte des priorités. Cette approche fonctionne dans des conditions de faible contention, mais devient inefficace lorsque plusieurs types de workloads (entraînement, inférence en temps réel, inférence par lots, quantification) se disputent les mêmes ressources. Les workloads d’entraînement, d’inférence par lots et de quantification nécessitent des blocs contigus de GPUs pour une durée prolongée, tandis que l’inférence en temps réel est élastique et dépend d’une courbe de demande variable. La coexistence de ces deux formes d’allocation sur le même cluster en temps réel crée une contention que le FIFO ne résout pas.

L’allocateur contraint développé par Hugging Face et Dharma AI formalise le problème comme un choix binaire par combinaison de GPU, job et timestep, produisant une grille d’allocation sur l’horizon de planification. Il intègre les contraintes de priorité et les exigences matérielles pour optimiser l’utilisation des ressources, transformant une politique d’allocation aveugle en une stratégie valorisant la priorité des jobs. Les auteurs soulignent que cette approche généralise la gestion des GPU en entreprise, où l’utilisation des ressources, et non l’intelligence des modèles, constitue le prochain goulot d’étranglement.

Réagir :
Partager —XLinkedIn
Sources citées