01 发生了什么
Google 在 9 月的开发者文章中介绍了 Gemini 3.5 Transcribe 的功能。这款模型此前一个月已发布;此次介绍重点包括实时转写、自定义词汇和音频文件处理。
02 关键细节
- 支持超过 85 种语言的实时流式转写,并具备自动识别与切换能力。
- 支持 custom_vocabulary 功能,开发者可添加最多 1000 个行业术语或专有名词以提升识别准确度。
- 支持处理长达 1 小时的音频文件,并提供说话人识别、时间戳标注及自动文本清洗输出。
- 据 Google 内部评估,流式转写的平均词错误率(WER)为 4.0%,批量处理模式为 2.6%。
03 为什么重要
自定义词汇和文本整理功能让开发者能够针对专业术语调整转写流程。Google 报告的词错误率来自其自身评估,实际效果仍需按应用场景验证。
04 适合谁
软件开发人员及从事语音接口工作的工程师。
原始来源Google