watch·ia
AccueilActusTutosGlossaireCette semaineTendancesSources
/
ACTUS
1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·1 aoûtUn juge américain valide l'interdiction des applications 'nudify' au Minnesota malgré xAI·1 aoûtReddit envisage de rompre son accord avec Google pour ses AI Overviews·31 juil.OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes·31 juil.Reddit maintient un procès DMCA contre un scraper malgré l'échec de Google·31 juil.L'Inde dépasse 345 millions de dollars de revenus applicatifs au T2 2026·31 juil.Anthropic révèle que son IA Claude a accédé à trois réseaux sans autorisation·31 juil.Google Earth retire en un jour un outil d'édition d'images par IA après des détournements·31 juil.Google Earth ajoute un générateur d'images IA avec filigrane SynthID·31 juil.Snapchat modifie ses algorithmes pour limiter les récompenses aux contenus Spotlight 100 % générés par IA·31 juil.Les majors musicales veulent exclure les morceaux 100 % générés par IA des classements·

Hugging Face détaille sa stratégie de données pour PRX, son modèle de génération d'images

lundi 6 juillet 202615:302 min de lecture1 source citée
L'essentiel — 3 points
  • 01Hugging Face assemble les données de PRX à partir de sources publiques et internes, puis les re-caption avec un VLM avant de les convertir en format MDS pour l'entraînement.
  • 02La stratégie privilégie la diversité et la couverture visuelle au pré-entraînement plutôt que la perfection esthétique, réservant le polissage au fine-tuning.
  • 03Le pipeline inclut exploration vectorielle, re-captionnage unifié, bucketing par résolution, filtrage et déduplication pour construire un corpus streamable.
Hugging Face détaille sa stratégie de données pour PRX, son modèle de génération d'images

Hugging Face a publié les détails de sa pipeline de données pour PRX, son modèle de génération d'images. L'approche combine des datasets publics et internes, re-captionnés via un modèle de vision-langage (VLM), puis structurés dans un format streamable pour l'entraînement.

La stratégie repose sur trois principes clés. D'abord, la diversité prime sur la perfection : l'objectif du pré-entraînement est d'assembler un corpus large et représentatif couvrant la variété visuelle du monde — objets, scènes, compositions, éclairages — plutôt que de sur-filtrer pour l'esthétique. Hugging Face estime qu'un dataset large et imparfait enseigne au modèle bien plus sur la structure visuelle qu'un corpus petit et très curé. Le polissage des générations est repoussé au fine-tuning et à l'alignement des préférences sur des ensembles réduits et rigoureusement sélectionnés.

Deuxième principe : tirer parti du travail de curation existant. Plutôt que de construire un corpus de zéro, Hugging Face s'appuie sur des sources publiques et internes déjà filtrées, dédupliquées et nettoyées (contenu NSFW, données personnelles). Les données arrivent sous formes variées — images avec métadonnées, ou métadonnées avec captions de base — et sont harmonisées dans un format commun.

La pipeline elle-même s'articule en plusieurs étapes. Les données existantes et leurs embeddings sont d'abord explorées dans Lance, une base de données vectorielle. Ensuite, toutes les images sont re-captionnées avec un VLM pour obtenir des descriptions cohérentes. Les données sont alors converties en Mosaic Data Shards (MDS), un format propriétaire choisi pour son efficacité de streaming, avec bucketing par résolution et ratio d'aspect. Enfin, filtrage et déduplication complètent le pipeline avant entraînement.

Cette approche reflète une philosophie : le pré-entraînement vise la couverture et la diversité conceptuelle, tandis que le fine-tuning affine le goût et la qualité perceptuelle. Hugging Face reconnaît que la pipeline de données, bien que peu spectaculaire, a été cruciale pour la qualité finale de PRX.

Réagir :
Partager —XLinkedIn
Sources citées