01 Что произошло
Авторы Hugging Face сообщили о создании Open TTS Leaderboard — платформы для оценки моделей синтеза речи по объективным метрикам. Она измеряет разборчивость через WER/CER с помощью Qwen3 ASR, скорость через RTFx для пакетного офлайн-инференса на H200 и TTFA для стриминга с размером батча 1 на H200 и CPU, а также сходство диктора через косинусное сходство эмбеддингов WavLM. Результаты для CPU доступны лишь для небольшого, но растущего числа моделей.
02 Ключевые детали
- По умолчанию рейтинг строится по макросреднему WER на английских сплитах Seed TTS Eval и CV3 Eval. Для языков без аудио в Seed TTS Eval используется только CV3 Eval, а для китайского, японского и корейского — CER.
- В стриминговом сравнении каждая модель обрабатывает по одному аудио на тех же 50 английских промптах CV3-Eval, с голосом модели по умолчанию и на том же оборудовании. Первые 3 запуска отбрасываются как разогрев, затем публикуется медианный TTFA.
- По словам авторов, объективная оценка сокращает проверку модели с пары недель сбора голосов до пары часов. При этом лидерборд не заменяет рейтинг человеческих предпочтений, а WER и сходство диктора не измеряют естественность и выразительность.
- По собственным результатам авторов, Kokoro-82M, supertonic-3 и fishaudio/s2-pro лидируют по английскому WER. Эти результаты получены в тестах Hugging Face и не прошли независимую проверку; скрипты оценки авторы обещают вскоре открыть.
03 Почему это важно
Для разработчиков это быстрый и воспроизводимый способ сравнивать модели без многонедельного сбора голосов. Но WER и сходство диктора остаются прокси-метриками: они не измеряют естественность, выразительность и предпочтения слушателей, а лидерборд не заменяет человеческий рейтинг.
04 Кому полезно
Инженеры голосовых систем, специалисты по оценке моделей и команды, выбирающие TTS-модели.