Hugging Face et Dharma AI augmentent l'utilisation des GPU de 33 points avec un ordonnanceur contraint
- 01Un allocateur contraint améliore l'utilisation des GPU de 33 points de pourcentage par rapport à un ordonnanceur FIFO dans des benchmarks comparables.
- 02L'inférence en temps réel et les workloads batch (entraînement, inférence par lots, quantification) entrent en contention sur les mêmes ressources, que le FIFO ne gère pas efficacement.
- 03Les gains proviennent uniquement de l'ordre des décisions d'allocation, sans modification matérielle ni changement de workload.

Hugging Face et Dharma AI annoncent une hausse de 33 points de pourcentage de l’utilisation des GPU dans des scénarios de benchmark comparables, en remplaçant un ordonnanceur FIFO par un allocateur contraint par les priorités et les contraintes matérielles.
L’expérience, menée sur des hardwares identiques et des workloads identiques, compare un ordonnanceur FIFO à un allocateur contraint sur sept scénarios de benchmark. Les résultats montrent une augmentation de l’utilisation des GPU jusqu’à 33 points de pourcentage, ainsi qu’une hausse de 105 % de la production pondérée par la priorité dans tous les scénarios testés. Aucun changement matériel n’a été apporté : seule l’ordre des décisions d’allocation a été modifié. Les gains sont exprimés en amélioration par rapport aux résultats obtenus avec l’ordonnanceur FIFO sur chaque scénario.
L’ordonnanceur FIFO réserve une capacité fixe pour l’inférence en temps réel et place les autres jobs dans l’ordre d’arrivée, sans tenir compte des priorités. Cette approche fonctionne dans des conditions de faible contention, mais devient inefficace lorsque plusieurs types de workloads (entraînement, inférence en temps réel, inférence par lots, quantification) se disputent les mêmes ressources. Les workloads d’entraînement, d’inférence par lots et de quantification nécessitent des blocs contigus de GPUs pour une durée prolongée, tandis que l’inférence en temps réel est élastique et dépend d’une courbe de demande variable. La coexistence de ces deux formes d’allocation sur le même cluster en temps réel crée une contention que le FIFO ne résout pas.
L’allocateur contraint développé par Hugging Face et Dharma AI formalise le problème comme un choix binaire par combinaison de GPU, job et timestep, produisant une grille d’allocation sur l’horizon de planification. Il intègre les contraintes de priorité et les exigences matérielles pour optimiser l’utilisation des ressources, transformant une politique d’allocation aveugle en une stratégie valorisant la priorité des jobs. Les auteurs soulignent que cette approche généralise la gestion des GPU en entreprise, où l’utilisation des ressources, et non l’intelligence des modèles, constitue le prochain goulot d’étranglement.
Articles liés
Hugging Face introduit un nouveau type de dépôt pour les kernels optimisés
Découvrez les optimisations techniques des kernels de Hugging Face pour accélérer les modèles d'IA générative.
Flash-KMeans : un algorithme de clustering k-means 200 fois plus rapide que FAISS sur GPU
Présentation de Flash-KMeans, une implémentation open-source exacte et optimisée pour GPU du k-means classique, surpassant FAISS et cuML en performances, sans approximation mathématique.

Nvidia étend son avantage IA avec des systèmes d'orchestration pour centres de données
Analyse des innovations techniques pour optimiser l'efficacité des centres de données.