Hugging Face évalue la reproductibilité de 2 200 articles de l'ICML 2026
- 01Plus de 1 200 participants ont reproduit 2 226 articles de l'ICML 2026 en 19 jours via un hackathon organisé par Hugging Face.
- 02La croissance du nombre de publications à l'ICML dépasse la capacité des relecteurs bénévoles, certains reconnaissant ne pas avoir vérifié toutes les preuves.
- 03Les agents de codage permettent une vérification accélérée, mais révèlent aussi des écarts entre les affirmations initiales et les résultats reproduits.
Une initiative de Hugging Face a mobilisé plus de 1 200 participants pour reproduire 2 226 articles acceptés à l'ICML 2026, révélant des défis de reproductibilité dans la recherche en IA.
Entre le 15 juillet et le 2 août 2026, Hugging Face a organisé un hackathon où des agents de codage et des contributeurs humains ont tenté de vérifier les affirmations scientifiques de 2 226 articles publiés lors de la conférence ICML 2026. Sur les 6 352 articles acceptés cette année-là, environ un tiers a été reproduit, générant 6 816 journaux de suivi via la plateforme Trackio. L'objectif était d'évaluer la fiabilité des résultats dans un contexte où le volume de publications explose, notamment avec l'automatisation des expériences et des rédactions.
Les organisateurs soulignent que la croissance exponentielle du nombre de soumissions à l'ICML — 23 918 en 2026, soit près du double par rapport à l'année précédente — dépasse largement la capacité des relecteurs bénévoles. Certains relecteurs ont explicitement reconnu ne pas avoir vérifié toutes les preuves ou démonstrations, comme l'illustre un commentaire : « Ma faible confiance s'explique par le fait que je n'ai pas vérifié toutes les preuves attentivement. » Malgré cela, l'article concerné a obtenu une note élevée et une distinction de type spotlight.
L'expérience a montré que les agents de codage, capables de lire un article, d'écrire le code, de lancer des expériences et d'en rendre compte, peuvent accélérer significativement le processus de vérification. Cependant, les résultats ont aussi mis en lumière des cas où les affirmations initiales ne résistaient pas à une réexécution rigoureuse. Certains articles ont vu leurs conclusions remises en cause, tandis que d'autres ont confirmé leur robustesse. Ces écarts soulèvent des questions sur la rigueur des processus de relecture actuels et sur l'adéquation des outils automatisés pour garantir la qualité scientifique à grande échelle.
Articles liés

Hugging Face et Pollen Robotics lancent Microduck, un robot bipède rollerskateur open source
Découverte d'un nouveau robot IA ludique et accessible, idéal pour les développeurs et passionnés de robotique.

Hugging Face et Dharma AI augmentent l'utilisation des GPU de 33 points avec un ordonnanceur contraint
Apprendre comment l'optimisation des clusters GPU booste l'efficacité des modèles.

Strands Agents et LeRobot s’intègrent à Hugging Face pour un flux IA unifié
Découverte d'un outil permettant d'enregistrer, entraîner et déployer des modèles IA depuis une seule interface.