NVIDIA NeMo Automodel et Hugging Face Diffusers s’allient pour le fine-tuning vidéo et image
- 01NVIDIA NeMo Automodel et Hugging Face Diffusers s’intègrent pour entraîner des modèles vidéo et image à grande échelle.
- 02Les modèles compatibles incluent FLUX.1-dev, Wan 2.1 et HunyuanVideo sans conversion de checkpoint.
- 03Le workflow repose sur quatre étapes et permet une parallélisation flexible d’une à plusieurs centaines de GPU.

NVIDIA et Hugging Face annoncent une intégration entre NVIDIA NeMo Automodel et Hugging Face Diffusers pour entraîner à grande échelle des modèles de génération vidéo et image sans conversion de checkpoint ni réécriture de code.
Cette collaboration permet d’utiliser directement des modèles hébergés sur Hugging Face Hub dans NeMo Automodel, une bibliothèque open source basée sur PyTorch et DTensor. Les modèles compatibles incluent des références comme FLUX.1-dev pour le texte vers image, ou Wan 2.1 et HunyuanVideo pour le texte vers vidéo. Les checkpoints entraînés peuvent être réutilisés dans l’écosystème Diffusers sans modification, garantissant une compatibilité totale entre les deux outils.
Le workflow de fine-tuning repose sur quatre étapes clés : le pré-encodage du jeu de données, le lancement de l’entraînement via un fichier YAML existant (comme celui de FLUX), la génération d’images ou vidéos à partir du checkpoint affiné, et l’évaluation des performances. La configuration permet une parallélisation flexible, adaptable d’une à plusieurs centaines de GPU sans réécrire le code. Les exemples de fine-tuning disponibles couvrent aussi bien des ajustements complets que des méthodes comme LoRA.
L’intégration est documentée dans le guide de formation de Diffusers et distribuée sous licence Apache 2.0. Elle cible les chercheurs et développeurs confrontés à des besoins de mémoire optimisée, de mise en cache latente et de gestion multi-résolutions.
Articles liés
Hugging Face publie un guide pour affiner des modèles en 100 étapes avec GRPO
Découvrez une méthode de fine-tuning optimisée pour générer des sorties structurées avec des modèles de taille réduite.

Nvidia propose PAIR, un outil gratuit pour agréger des PC locaux en cluster d'inférence IA
Découvrir comment exploiter des machines inutilisées pour des tâches d'inférence IA locale.

NeoMME : un encodeur multimodal multilingue open source sans tour de vision séparée
Explorer une innovation open-source majeure pour les modèles d'IA polyvalents.