01 Was passiert ist

Google erläuterte im September die Entwicklerfunktionen von Gemini 3.5 Transcribe. Das Modell war bereits im Vormonat erschienen und verarbeitet Live-Audio sowie aufgezeichnete Dateien.

02 Die wichtigsten Details

  • Unterstützt Streaming-Transkription in über 85 Sprachen mit automatischer Umschaltung zwischen Sprachen.
  • Integration von bis zu 1.000 Begriffen via custom_vocabulary zur präzisen Erkennung von Fachsprache und Eigennamen.
  • Bereitstellung von Zeitstempeln, Sprecherlabels und intelligenter Textbereinigung für Dateien bis zu einer Stunde über die Interactions API.
  • Google gibt in eigenen internen Analysen eine durchschnittliche Wortfehlerrate von 4,0 % für Streaming und 2,6 % für Dateitranskription an.

03 Warum das wichtig ist

Durch die Anpassung des Vokabulars und automatisierte Textkorrektur können Entwickler die Qualität der Spracherkennung in ihren Anwendungen optimieren.

04 Für wen es relevant ist

Softwareentwickler und Ingenieure für Sprachschnittstellen.

OriginalquelleGoogle