01 Что произошло

Авторы Hugging Face сообщили о создании Open TTS Leaderboard — платформы для оценки моделей синтеза речи по объективным метрикам. Она измеряет разборчивость через WER/CER с помощью Qwen3 ASR, скорость через RTFx для пакетного офлайн-инференса на H200 и TTFA для стриминга с размером батча 1 на H200 и CPU, а также сходство диктора через косинусное сходство эмбеддингов WavLM. Результаты для CPU доступны лишь для небольшого, но растущего числа моделей.

02 Ключевые детали

  • По умолчанию рейтинг строится по макросреднему WER на английских сплитах Seed TTS Eval и CV3 Eval. Для языков без аудио в Seed TTS Eval используется только CV3 Eval, а для китайского, японского и корейского — CER.
  • В стриминговом сравнении каждая модель обрабатывает по одному аудио на тех же 50 английских промптах CV3-Eval, с голосом модели по умолчанию и на том же оборудовании. Первые 3 запуска отбрасываются как разогрев, затем публикуется медианный TTFA.
  • По словам авторов, объективная оценка сокращает проверку модели с пары недель сбора голосов до пары часов. При этом лидерборд не заменяет рейтинг человеческих предпочтений, а WER и сходство диктора не измеряют естественность и выразительность.
  • По собственным результатам авторов, Kokoro-82M, supertonic-3 и fishaudio/s2-pro лидируют по английскому WER. Эти результаты получены в тестах Hugging Face и не прошли независимую проверку; скрипты оценки авторы обещают вскоре открыть.

03 Почему это важно

Для разработчиков это быстрый и воспроизводимый способ сравнивать модели без многонедельного сбора голосов. Но WER и сходство диктора остаются прокси-метриками: они не измеряют естественность, выразительность и предпочтения слушателей, а лидерборд не заменяет человеческий рейтинг.

04 Кому полезно

Инженеры голосовых систем, специалисты по оценке моделей и команды, выбирающие TTS-модели.

ПервоисточникHugging Face