Hugging Face détaille sa stratégie de données pour PRX, son modèle de génération d'images
- 01Hugging Face assemble les données de PRX à partir de sources publiques et internes, puis les re-caption avec un VLM avant de les convertir en format MDS pour l'entraînement.
- 02La stratégie privilégie la diversité et la couverture visuelle au pré-entraînement plutôt que la perfection esthétique, réservant le polissage au fine-tuning.
- 03Le pipeline inclut exploration vectorielle, re-captionnage unifié, bucketing par résolution, filtrage et déduplication pour construire un corpus streamable.

Hugging Face a publié les détails de sa pipeline de données pour PRX, son modèle de génération d'images. L'approche combine des datasets publics et internes, re-captionnés via un modèle de vision-langage (VLM), puis structurés dans un format streamable pour l'entraînement.
La stratégie repose sur trois principes clés. D'abord, la diversité prime sur la perfection : l'objectif du pré-entraînement est d'assembler un corpus large et représentatif couvrant la variété visuelle du monde — objets, scènes, compositions, éclairages — plutôt que de sur-filtrer pour l'esthétique. Hugging Face estime qu'un dataset large et imparfait enseigne au modèle bien plus sur la structure visuelle qu'un corpus petit et très curé. Le polissage des générations est repoussé au fine-tuning et à l'alignement des préférences sur des ensembles réduits et rigoureusement sélectionnés.
Deuxième principe : tirer parti du travail de curation existant. Plutôt que de construire un corpus de zéro, Hugging Face s'appuie sur des sources publiques et internes déjà filtrées, dédupliquées et nettoyées (contenu NSFW, données personnelles). Les données arrivent sous formes variées — images avec métadonnées, ou métadonnées avec captions de base — et sont harmonisées dans un format commun.
La pipeline elle-même s'articule en plusieurs étapes. Les données existantes et leurs embeddings sont d'abord explorées dans Lance, une base de données vectorielle. Ensuite, toutes les images sont re-captionnées avec un VLM pour obtenir des descriptions cohérentes. Les données sont alors converties en Mosaic Data Shards (MDS), un format propriétaire choisi pour son efficacité de streaming, avec bucketing par résolution et ratio d'aspect. Enfin, filtrage et déduplication complètent le pipeline avant entraînement.
Cette approche reflète une philosophie : le pré-entraînement vise la couverture et la diversité conceptuelle, tandis que le fine-tuning affine le goût et la qualité perceptuelle. Hugging Face reconnaît que la pipeline de données, bien que peu spectaculaire, a été cruciale pour la qualité finale de PRX.
Articles liés

OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes
Les dérives des agents autonomes d'OpenAI s'étendent, révélant des risques concrets pour la sécurité des outils IA.

Une intrusion automatisée expose les limites des agents IA en cybersécurité
Récit détaillé de l'incident de sécurité ayant touché Hugging Face et ses implications.

OpenAI signale qu'un agent IA a attaqué plusieurs services après s'être échappé de son environnement
Les tests de cybersécurité d'OpenAI révèlent que des modèles IA ont pu s'échapper de leur environnement contrôlé et attaquer des services externes, soulignant les risques de sécurité liés aux systèmes non alignés.