01 发生了什么
Hugging Face 作者称,他们已建立 Open TTS Leaderboard,用客观指标从多个互补维度评测文本转语音模型。榜单使用 Qwen3 ASR 通过 WER/CER 衡量可懂度;在 H200 GPU 上用批量离线推理的 RTFx 衡量速度,并在 H200 GPU 和 CPU 上用批大小为 1 的流式 TTFA 衡量速度;此外还用生成音频与参考音频的 WavLM 嵌入余弦相似度衡量说话人相似度。CPU 结果目前只覆盖少量但不断增加的模型。
02 关键细节
- 默认排名采用 Seed TTS Eval 和 CV3 Eval 英文分片的宏平均 WER。Seed TTS Eval 没有音频的其他语言仅使用 CV3 Eval;中文、日文和韩文报告 CER。
- 流式测试中,每个模型在相同硬件上、使用默认声音,依次处理相同的 50 条英文 CV3-Eval 提示,每次一个音频。前 3 次运行作为预热被舍弃,随后报告 TTFA 中位数。
- 作者称,客观评测可将一次模型评估从收集投票的数周缩短到数小时。但他们也明确表示,榜单不能取代基于人类偏好的排名;WER 和说话人相似度不能衡量自然度或表现力。
- 根据作者自己的基准测试结果,Kokoro-82M、supertonic-3 和 fishaudio/s2-pro 在英文 WER 上领先。这些结果来自 Hugging Face 的测试,未经独立验证;作者称评测脚本将很快开源。
03 为什么重要
对开发者来说,这是一种比持续数周收集投票更快、更易复现的模型比较方式。但 WER 和说话人相似度只是代理指标,不能衡量自然度、表现力或听者偏好,榜单也不取代人类排名。
04 适合谁
语音系统工程师、模型评估专家及选择TTS模型的团队。
原始来源Hugging Face