- Published on
Gemini 3.5 Transcribe:85种语言,错误率2.6% — 谷歌重新定义语音识别标准
会议结束,会议记录已经自动生成完毕。讲座结束,字幕自动附上。这个时代已经到来。
谷歌于2026年8月26日正式公开Gemini 3.5 Transcribe。这不仅仅是一个语音识别模型——它重写了行业精确度标准,树立了新的基准。
数字说话:WER 2.6%
衡量语音识别质量的核心指标是单词错误率(WER,Word Error Rate)——每100个单词中有多少个被错误识别。
Gemini 3.5 Transcribe的非流式WER为2.6%,流式模式为4.0%。根据Artificial Analysis的基准测试,这一数值位居目前公开的商业语音识别模型最高水平之列。
| 模式 | WER | 特点 |
|---|---|---|
| 非流式 (gemini-3.5-transcribe) | 2.6% | 预录文件,基于发话的语言检测 |
| 流式 (gemini-3.5-transcribe-live) | 4.0% | 实时WebSocket流式传输 |
WER 2.6%意味着每100个单词只有约2-3个错误——与人类打字的错字率相当甚至更低。
两种模式,各有用途
非流式模式:处理预录文件
适用于讲座视频、播客、采访录音等已完成的音频文件。上传文件后,系统按发话自动检测语言并进行转录。
- 支持85种以上语言
- 说话人分离(Speaker Diarization):自动区分"A说了什么"和"B说了什么"
- 词级时间戳:记录每个单词在哪个时间点被说出
- 自定义词汇设置:可以指定最多1000个特定术语(人名、产品名、行业专业术语)优先识别
流式模式:实时对话
在Live API上运行的实时流式传输。通过WebSocket连接,说话的同时文字就会生成。
- 同时返回中间结果(interim)和最终结果(finalized)
- 智能转录模式:自动整理填充语("嗯..."、"那个...")和重复内容
- 支持多种语音活动检测(VAD)策略
发话级语言检测:多语言内容的救星
这个功能尤其引人注目。它不是对整个录音文件进行语言检测,而是按发话进行语言检测。
例如,一方用中文说话、另一方用英文说话的采访文件上传后,系统会对每个发话自动检测语言并用相应语言转录。在国际学术会议、全球团队会议、多语言社区的录音资料处理上,这是一个强大的工具。
教育场景中的实用建议
从教育技术角度,列举三个最实用的应用场景:
1. 讲座自动字幕生成 教师录制视频后,将音频文件提供给Gemini 3.5 Transcribe,就能自动生成带时间戳的字幕数据,省去了手动编辑字幕的工作。
2. 学生演讲评估辅助 录制学生演讲后进行转录,可以基于文本提供反馈或辅助评分。开启说话人分离功能后,还可以在小组演讲中测量每位学生的发言量。
3. 多语言学生支持 母语非目标语言的学生用母语回答的内容可以被转录,教师结合翻译工具理解内容。
自定义词汇功能:避免专有名词的陷阱
AI语音识别始终面临挑战的领域:人名、品牌名、技术术语、地区特有词汇。
Gemini 3.5 Transcribe可以指定最多1000个自定义词汇(Custom Vocabulary)。将一般语言模型不熟悉的词汇加入列表,系统就会优先识别这些词汇。
费用与使用方法
通过Gemini API访问。可以直接在Google AI Studio中测试,商业使用遵循Google Cloud AI的定价体系。目前处于GA(正式发布)状态。
开始使用很简单:
- Google AI Studio → 获取Gemini API密钥
- 向
gemini-3.5-transcribe模型端点发送音频文件 - 需要实时流式传输时,通过WebSocket连接
gemini-3.5-transcribe-live
总结
Gemini 3.5 Transcribe将语音识别从"勉强够用"提升到了"可以信任"的水平。特别是在多语言环境、专业术语较多的领域以及需要实时转录的服务中,它可以成为改变游戏规则的工具。
随着语音转文字技术成为教育内容制作和学习支持的基础设施,准确捕捉语音本身就是教育可及性的问题。
Sources: