watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Hugging Face simplifie la distillation de connaissances pour des modèles légers

lundi 10 août 202610:052 min de lecture1 source citée
L'essentiel — 3 points
  • 01La distillation de connaissances permet de compresser des grands modèles de langage en modèles plus petits tout en conservant leurs performances.
  • 02Hugging Face réduit les coûts de distillation en mettant en cache les top-K logits du modèle enseignant et en optimisant la fonction de perte KL.
  • 03Ces modifications permettent d’entraîner des modèles à long contexte sur une seule GPU, rendant la distillation plus accessible.
Hugging Face simplifie la distillation de connaissances pour des modèles légers

Hugging Face publie une méthode de distillation de connaissances optimisée pour réduire les coûts de formation des grands modèles de langage.

La distillation de connaissances consiste à entraîner un modèle étudiant plus petit pour qu’il reproduise les performances d’un modèle enseignant plus grand. Cette technique est devenue courante avec l’essor des grands modèles de langage open source, comme gpt-oss, Qwen, GLM ou Kimi, dont les versions récentes nécessitent des ressources matérielles importantes. Par exemple, le modèle Kimi-K3 compte 2,8 billions de paramètres et requiert environ 3 To de VRAM pour être chargé. La compression de ces modèles via distillation permet de réduire leur taille tout en conservant leurs capacités, comme le montrent des initiatives récentes comme Nemotron 3 Puzzle 75B de Nvidia ou Hypernova 60B de Multiverse Computing.

Cependant, l’étape de distillation elle-même est souvent la plus coûteuse du processus. Elle implique de maintenir simultanément les deux modèles en mémoire et de générer une distribution de probabilités sur l’ensemble du vocabulaire pour chaque token. Cette opération nécessite généralement des centaines de GPU et des stratégies complexes de parallélisme tensoriel. Pour y remédier, Hugging Face propose deux modifications techniques dans un article intitulé Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss.

La première consiste à mettre en cache les top-K logits du modèle enseignant une seule fois, évitant ainsi de devoir le recharger en mémoire à chaque étape d’entraînement. La seconde introduit une nouvelle fonction de perte KL divergente, optimisée pour réduire l’empreinte mémoire en évitant de matérialiser la matrice complète vocabulaire × longueur de séquence. Ensemble, ces deux changements permettent de réduire significativement l’usage de VRAM, rendant possible l’entraînement de modèles à long contexte sur une seule GPU et rendant l’expérimentation à grande échelle plus accessible.

Ces améliorations ciblent directement les limites matérielles actuelles de la distillation, où la mémoire et la puissance de calcul sont souvent des goulots d’étranglement majeurs.

Réagir :
Partager —XLinkedIn
Sources citées