01 Ce qui s’est passé
Les auteurs de Hugging Face annoncent avoir créé l’Open TTS Leaderboard, qui évalue les modèles de synthèse vocale à l’aide de métriques objectives couvrant plusieurs aspects complémentaires. L’intelligibilité est mesurée par le WER/CER avec Qwen3 ASR, la vitesse par le RTFx pour l’inférence hors ligne par lots sur un GPU H200 et par le time-to-first-audio pour le streaming avec une taille de lot de 1 sur H200 et CPU. La similarité de locuteur repose sur la similarité cosinus entre des embeddings WavLM. Les résultats CPU ne concernent qu’un petit ensemble de modèles, qui s’étoffe.
02 Les points essentiels
- Le classement par défaut repose sur le WER moyen agrégé des splits anglais de Seed TTS Eval et CV3 Eval. Lorsque Seed TTS Eval ne contient pas d’audio, les autres langues utilisent uniquement CV3 Eval ; le chinois, le japonais et le coréen sont évalués avec le CER.
- Pour le streaming, chaque modèle traite un audio à la fois sur les mêmes 50 prompts anglais de CV3-Eval, avec sa voix par défaut et le même matériel. Les 3 premières exécutions sont écartées pour l’échauffement, puis la médiane du TTFA est publiée.
- Selon les auteurs, l’évaluation objective ramène la durée d’une évaluation de quelques semaines de collecte de votes à quelques heures. Le leaderboard ne remplace toutefois pas le classement fondé sur les préférences humaines ; le WER et la similarité de locuteur ne mesurent ni le naturel ni l’expressivité.
- D’après les résultats de leurs propres benchmarks, Kokoro-82M, supertonic-3 et fishaudio/s2-pro arrivent en tête pour le WER anglais. Ces résultats proviennent de tests réalisés par Hugging Face et n’ont pas été vérifiés indépendamment ; les scripts d’évaluation seront bientôt publiés en open source, selon les auteurs.
03 Pourquoi c’est important
Pour les développeurs, le leaderboard offre une comparaison plus rapide et plus reproductible que la collecte de votes sur plusieurs semaines. Mais le WER et la similarité de locuteur restent des proxys : ils ne mesurent ni le naturel, ni l’expressivité, ni les préférences des auditeurs, et le classement ne les remplace pas.
04 Pour qui c’est utile
Ingénieurs des systèmes vocaux, spécialistes de l'évaluation de modèles et équipes qui sélectionnent des modèles TTS.