- 01Le FFASR Leaderboard est le premier benchmark open évaluant l'ASR en conditions acoustiques réelles, loin des scénarios contrôlés traditionnels.
- 02Les modèles testés affichent un WER en far-field plusieurs fois supérieur à celui en near-field, révélant un écart persistant entre évaluation et déploiement réel.
- 03Le benchmark combine simulations et validations réelles, avec des métriques de précision (WER) et de rapidité (RTFx) pour guider les choix de déploiement.
Le FFASR Leaderboard, premier benchmark open et communautaire, évalue désormais les modèles de reconnaissance automatique de la parole (ASR) dans des conditions acoustiques réalistes, loin des scénarios contrôlés des benchmarks traditionnels.
Ce benchmark, développé par Treble Technologies et Hugging Face, simule 14 pièces aux propriétés acoustiques variées pour tester les modèles face à des défis comme la réverbération, le bruit de fond ou la distance entre le locuteur et le microphone. Contrairement aux évaluations classiques en champ proche (near-field), qui reposent sur des enregistrements propres et proches, le FFASR Leaderboard intègre des mesures en champ lointain (far-field) avec des rapports signal/bruit (SNR) faibles. Les résultats montrent déjà un écart significatif : pour tous les modèles soumis, le taux d'erreur de mots (WER) en far-field à bas SNR est plusieurs fois supérieur à celui mesuré en near-field sur le même contenu vocal.
La méthodologie repose sur une hybridation entre simulations basées sur des ondes et validations réelles, avec des scénarios incluant des sources mobiles et des données audio réservées à l'évaluation. Chaque soumission est évaluée selon deux critères : la précision (WER) et la rapidité (RTFx), permettant de visualiser le compromis performance/vitesse via des courbes de front de Pareto. Les données sont standardisées grâce à un matériel d'évaluation commun à toutes les soumissions, garantissant une comparabilité directe.
Les organisateurs invitent la communauté à soumettre des modèles, analyser les résultats et contribuer à l'évolution du benchmark. Les prochaines étapes incluent l'ajout de scénarios multi-locuteurs, le support des réseaux de microphones et l'intégration de l'annulation d'écho, afin de refléter des cas d'usage toujours plus complexes comme les assistants vocaux en environnement bruyant ou les systèmes de transcription en salle de conférence.
Articles liés
Hugging Face intègre l'hindi et l'anglais indien à son classement ASR open
Pour les développeurs travaillant sur des modèles multilingues, cette intégration élargit les possibilités de reconnaissance vocale.
Hugging Face crée un benchmark pour détecter l'optimisation abusive des modèles ASR
Découvrez comment Hugging Face évalue l'optimisation des modèles de reconnaissance automatique de la parole (ASR) avec un nouveau benchmark.

AllenAI dévoile BenchMIRT pour disséquer les signaux des benchmarks des LLM
AllenAI propose BenchMIRT pour analyser la pertinence des benchmarks des grands modèles de langage.