watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

Hugging Face publie un guide pratique pour profiler l'attention dans PyTorch

vendredi 10 juillet 202600:002 min de lecture1 source citée
L'essentiel — 3 points
  • 01Hugging Face publie un tutoriel pour profiler les mécanismes d'attention dans PyTorch avec le profileur intégré.
  • 02Quatre scripts d'exemple illustrent des variantes d'attention : naïve, masquage causal en place, SDPA et noyaux optimisés.
  • 03Les opérations matmul, softmax et masquage sont identifiées comme des points critiques dans les traces du profileur.
Hugging Face publie un guide pratique pour profiler l'attention dans PyTorch

Hugging Face publie un tutoriel détaillé pour analyser et optimiser les mécanismes d'attention dans PyTorch à l'aide du profileur intégré.

Le troisième volet de la série Profiling in PyTorch de Hugging Face se concentre sur l'analyse des opérations d'attention, un composant central des architectures de type Transformer. L'objectif n'est pas d'expliquer chaque optimisation possible, mais de montrer comment les différentes implémentations d'attention se manifestent dans les traces du profileur PyTorch. Quatre scripts d'exemple sont fournis pour illustrer des variantes d'attention : une implémentation naïve, une version avec masquage causal en place, une utilisant l'algorithme Scaled Dot-Product Attention (SDPA), et une exploitant des noyaux optimisés comme ceux de cuDNN.

Le tutoriel détaille les étapes classiques d'un mécanisme d'attention : calcul des scores (matmul entre queries et keys), mise à l'échelle, application d'un masque causal, normalisation par softmax, puis réévaluation des values. Chaque opération est profilée pour identifier les goulots d'étranglement. Par exemple, le calcul des scores (matmul) et l'application du masque apparaissent comme des points critiques dans les traces du profileur. Les auteurs soulignent que l'attention est souvent critiquée pour sa complexité quadratique, mais que des optimisations existent pour atténuer ce problème, sans pour autant les détailler exhaustivement.

Les scripts sont exécutables sur une infrastructure GPU NVIDIA A100-SXM4-80GB, accessible via les outils Hugging Face comme Dev Mode with Spaces ou le pipeline Jobs. Les lecteurs sont invités à exécuter ces exemples en parallèle de la lecture pour visualiser concrètement les différences entre les implémentations. Le guide s'inscrit dans une démarche pédagogique visant à rendre les développeurs autonomes dans l'analyse des performances des modèles PyTorch.

Réagir :
Partager —XLinkedIn
Sources citées