Hugging Face affiche les résultats de 229 000 évaluations communautaires sur ses fiches modèles
- 01Hugging Face affiche désormais 229 000 résultats d'évaluation provenant de 31 formats différents, couvrant 22 000 modèles et 2 200 benchmarks.
- 02Un schéma JSON standardisé (EEE) enregistre qui a exécuté l'évaluation, comment, et avec quels paramètres, pour résoudre les incohérences de rapportage.
- 03Un convertisseur automatique permet aux contributeurs d'envoyer les résultats EEE directement vers Community Evals sans dupliquer les données.

Hugging Face intègre désormais les résultats d'évaluations communautaires directement sur les pages de ses modèles, via une interopérabilité nouvelle entre sa plateforme Community Evals et le projet Every Eval Ever (EEE) lancé en février 2026.
Le projet EEE, porté par la coalition EvalEval, vise à standardiser la façon dont les résultats d'évaluation sont rapportés. Jusqu'à présent, ces résultats étaient dispersés dans des papiers, des leaderboards, des posts de blog et des logs, chacun dans son propre format. Cette fragmentation crée des incohérences : le même modèle sur le même benchmark peut afficher des scores très différents selon qui l'a exécuté et comment. LLaMA 65B, par exemple, a été rapporté à la fois à 63,7 et 48,8 sur MMLU, illustrant l'absence de standardisation des paramètres d'évaluation.
EEE propose un schéma JSON unique qui enregistre qui a exécuté l'évaluation, quel modèle a été testé, comment il a été accédé, les paramètres de génération utilisés et la signification réelle de la métrique. Depuis son lancement, le datastore de Hugging Face a accumulé environ 229 000 résultats d'évaluation couvrant plus de 22 000 modèles et 2 200 benchmarks, provenant de 31 formats de rapportage différents. Reproduire ces exécutions à partir de zéro coûterait des centaines de milliers de dollars.
La nouvelle intégration permet aux contributeurs d'envoyer directement les résultats EEE vers Hugging Face Community Evals via un convertisseur automatique qui transforme les enregistrements EEE en fichiers YAML attendus par la plateforme. Les développeurs peuvent ainsi consulter les performances de modèles sans maintenir les mêmes données dans deux formats différents. Cette fonctionnalité s'adresse à tous ceux qui rapportent ou consultent des évaluations, pas seulement aux contributeurs EEE existants.
Articles liés

Hugging Face publie trois nouveaux modèles OCR open source sous licence Apache 2.0
Découvrez les derniers modèles open source d'Hugging Face, optimisés pour des performances équivalentes aux versions précédentes tout en restant accessibles.
LeRobot v0.6.0 : Hugging Face ajoute modèles de monde et évaluation robotique
Découvrez les nouvelles fonctionnalités d'évaluation et de raffinement intégrées dans la version 0.6.0 de LeRobot pour optimiser les modèles IA.

OpenAI et Google renforcent les alertes sur les risques des outils IA autonomes
Les dérives des agents autonomes d'OpenAI s'étendent, révélant des risques concrets pour la sécurité des outils IA.