Hugging Face détaille sa stratégie de données pour PRX, son modèle de génération d'images
- 01Hugging Face assemble les données de PRX à partir de sources publiques et internes, puis les re-caption avec un VLM avant de les convertir en format MDS pour l'entraînement.
- 02La stratégie privilégie la diversité et la couverture visuelle au pré-entraînement plutôt que la perfection esthétique, réservant le polissage au fine-tuning.
- 03Le pipeline inclut exploration vectorielle, re-captionnage unifié, bucketing par résolution, filtrage et déduplication pour construire un corpus streamable.

Hugging Face a publié les détails de sa pipeline de données pour PRX, son modèle de génération d'images. L'approche combine des datasets publics et internes, re-captionnés via un modèle de vision-langage (VLM), puis structurés dans un format streamable pour l'entraînement.
La stratégie repose sur trois principes clés. D'abord, la diversité prime sur la perfection : l'objectif du pré-entraînement est d'assembler un corpus large et représentatif couvrant la variété visuelle du monde — objets, scènes, compositions, éclairages — plutôt que de sur-filtrer pour l'esthétique. Hugging Face estime qu'un dataset large et imparfait enseigne au modèle bien plus sur la structure visuelle qu'un corpus petit et très curé. Le polissage des générations est repoussé au fine-tuning et à l'alignement des préférences sur des ensembles réduits et rigoureusement sélectionnés.
Deuxième principe : tirer parti du travail de curation existant. Plutôt que de construire un corpus de zéro, Hugging Face s'appuie sur des sources publiques et internes déjà filtrées, dédupliquées et nettoyées (contenu NSFW, données personnelles). Les données arrivent sous formes variées — images avec métadonnées, ou métadonnées avec captions de base — et sont harmonisées dans un format commun.
La pipeline elle-même s'articule en plusieurs étapes. Les données existantes et leurs embeddings sont d'abord explorées dans Lance, une base de données vectorielle. Ensuite, toutes les images sont re-captionnées avec un VLM pour obtenir des descriptions cohérentes. Les données sont alors converties en Mosaic Data Shards (MDS), un format propriétaire choisi pour son efficacité de streaming, avec bucketing par résolution et ratio d'aspect. Enfin, filtrage et déduplication complètent le pipeline avant entraînement.
Cette approche reflète une philosophie : le pré-entraînement vise la couverture et la diversité conceptuelle, tandis que le fine-tuning affine le goût et la qualité perceptuelle. Hugging Face reconnaît que la pipeline de données, bien que peu spectaculaire, a été cruciale pour la qualité finale de PRX.
Articles liés
Hugging Face intègre l'hindi et l'anglais indien à son classement ASR open
Pour les développeurs travaillant sur des modèles multilingues, cette intégration élargit les possibilités de reconnaissance vocale.

Nvidia annonce le rachat de Hugging Face pour 12,9 milliards de dollars
Nvidia renforce son contrôle sur l'écosystème open source des modèles d'IA avec l'acquisition de la plateforme Hugging Face.

Hugging Face commercialise le robot canard open source Microduck à 399 $
Un robot open source et programmable est proposé aux développeurs pour un prix accessible.