Mesurer l'optimisation des benchmarks en reconnaissance vocale
22 août 2026 · IA · NVDA,MSFT,IBM
Des chercheurs de HumeAI publient une étude mesurant le phénomène de 'benchmaxxing' dans la reconnaissance automatique de la parole (ASR). Ils ont évalué 11 modèles open-source et constaté que plusieurs des systèmes les mieux classés reproduisent les transcriptions de référence des benchmarks VoxPopuli et LibriSpeech, même lorsque l'audio les contredit. Trois tests spécifiques ont été introduits pour quantifier ce biais, révélant que les modèles aux meilleurs scores sont aussi les plus susceptibles de reproduire des erreurs de référence. Ce travail remet en question la validité des classements actuels de performance ASR.