watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·4 sept.Crusoe lève 3 milliards de dollars pour une valorisation de 30 milliards·3 sept.Accel en pourparlers pour diriger une levée de 1 milliard chez Thinking Machines·3 sept.Abliteration.ai propose des modèles IA sans restrictions via une plateforme commerciale·3 sept.Meta propose des réductions pour partager les données d’usage de Muse Spark·3 sept.OpenAI présente GPT-6 Astra, son modèle le plus avancé à ce jour·3 sept.Ollie lance un assistant IA familial conforme SOC 2 pour préserver la confidentialité·3 sept.Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA·3 sept.Google ajoute des modes vocaux en temps réel pour Gmail, Docs et Keep·3 sept.Panne simultanée de ChatGPT, Grok et Claude : trois assistants IA majeurs inaccessibles·3 sept.Google améliore son modèle météo IA WeatherNext 3 avec une résolution cinq fois supérieure·

NVIDIA NeMo Automodel et Hugging Face Diffusers s’allient pour le fine-tuning vidéo et image

vendredi 17 juillet 202615:572 min de lecture1 source citée
L'essentiel — 3 points
  • 01NVIDIA NeMo Automodel et Hugging Face Diffusers s’intègrent pour entraîner des modèles vidéo et image à grande échelle.
  • 02Les modèles compatibles incluent FLUX.1-dev, Wan 2.1 et HunyuanVideo sans conversion de checkpoint.
  • 03Le workflow repose sur quatre étapes et permet une parallélisation flexible d’une à plusieurs centaines de GPU.
NVIDIA NeMo Automodel et Hugging Face Diffusers s’allient pour le fine-tuning vidéo et image

NVIDIA et Hugging Face annoncent une intégration entre NVIDIA NeMo Automodel et Hugging Face Diffusers pour entraîner à grande échelle des modèles de génération vidéo et image sans conversion de checkpoint ni réécriture de code.

Cette collaboration permet d’utiliser directement des modèles hébergés sur Hugging Face Hub dans NeMo Automodel, une bibliothèque open source basée sur PyTorch et DTensor. Les modèles compatibles incluent des références comme FLUX.1-dev pour le texte vers image, ou Wan 2.1 et HunyuanVideo pour le texte vers vidéo. Les checkpoints entraînés peuvent être réutilisés dans l’écosystème Diffusers sans modification, garantissant une compatibilité totale entre les deux outils.

Le workflow de fine-tuning repose sur quatre étapes clés : le pré-encodage du jeu de données, le lancement de l’entraînement via un fichier YAML existant (comme celui de FLUX), la génération d’images ou vidéos à partir du checkpoint affiné, et l’évaluation des performances. La configuration permet une parallélisation flexible, adaptable d’une à plusieurs centaines de GPU sans réécrire le code. Les exemples de fine-tuning disponibles couvrent aussi bien des ajustements complets que des méthodes comme LoRA.

L’intégration est documentée dans le guide de formation de Diffusers et distribuée sous licence Apache 2.0. Elle cible les chercheurs et développeurs confrontés à des besoins de mémoire optimisée, de mise en cache latente et de gestion multi-résolutions.

Réagir :
Partager —XLinkedIn
Sources citées