01 Was passiert ist

Die Autoren von Hugging Face berichten, sie hätten das Open TTS Leaderboard entwickelt, um Text-to-Speech-Modelle mit objektiven Kennzahlen in mehreren ergänzenden Leistungsbereichen zu bewerten. Gemessen werden die Verständlichkeit mit WER/CER und Qwen3 ASR, die Geschwindigkeit mit RTFx für gebündelte Offline-Inferenz auf einer H200-GPU sowie mit Time-to-First-Audio für Streaming bei Batchgröße 1 auf H200-GPU und CPU. Hinzu kommt die Sprecherähnlichkeit, berechnet als Kosinusähnlichkeit zwischen WavLM-Embeddings. CPU-Ergebnisse gibt es für einen kleinen, aber wachsenden Kreis von Modellen.

02 Die wichtigsten Details

  • Die Standardrangliste basiert auf dem Makro-WER der englischen Splits von Seed TTS Eval und CV3 Eval. Wo Seed TTS Eval kein Audiomaterial bietet, wird für andere Sprachen nur CV3 Eval verwendet; für Chinesisch, Japanisch und Koreanisch gilt CER.
  • Beim Streaming läuft jedes Modell einzeln auf denselben 50 englischen CV3-Eval-Prompts, mit der jeweiligen Standardstimme und auf derselben Hardware. Die ersten 3 Läufe dienen als Warmlauf und werden verworfen; ausgewiesen wird der mediane TTFA.
  • Laut den Autoren verkürzt die objektive Bewertung die Prüfung eines Modells von ein paar Wochen Abstimmungssammlung auf ein paar Stunden. Das Leaderboard ersetzt jedoch keine Rangliste menschlicher Präferenzen; WER und Sprecherähnlichkeit messen weder Natürlichkeit noch Ausdruck.
  • Nach den eigenen Benchmark-Ergebnissen der Autoren liegen Kokoro-82M, supertonic-3 und fishaudio/s2-pro beim englischen WER vorn. Diese Ergebnisse stammen aus Läufen von Hugging Face und sind nicht unabhängig überprüft; die Bewertungsskripte sollen bald als Open Source erscheinen.

03 Warum das wichtig ist

Für Entwickler bietet das Leaderboard einen schnelleren und reproduzierbareren Modellvergleich als das Sammeln von Stimmen über mehrere Wochen. WER und Sprecherähnlichkeit sind jedoch nur Näherungswerte: Sie messen weder Natürlichkeit, Ausdruck noch Zuhörerpräferenzen, und das Leaderboard ersetzt keine menschliche Rangliste.

04 Für wen es relevant ist

Ingenieure für Sprachsysteme, Spezialisten für Modellbewertung und Teams, die TTS-Modelle auswählen.

OriginalquelleHugging Face