minssam.
Published on

Gemini 3.5 Transcribe:85种语言,错误率2.6% — 谷歌重新定义语音识别标准

会议结束,会议记录已经自动生成完毕。讲座结束,字幕自动附上。这个时代已经到来。

谷歌于2026年8月26日正式公开Gemini 3.5 Transcribe。这不仅仅是一个语音识别模型——它重写了行业精确度标准,树立了新的基准。


数字说话:WER 2.6%

衡量语音识别质量的核心指标是单词错误率(WER,Word Error Rate)——每100个单词中有多少个被错误识别。

Gemini 3.5 Transcribe的非流式WER为2.6%,流式模式为4.0%。根据Artificial Analysis的基准测试,这一数值位居目前公开的商业语音识别模型最高水平之列。

模式WER特点
非流式 (gemini-3.5-transcribe)2.6%预录文件,基于发话的语言检测
流式 (gemini-3.5-transcribe-live)4.0%实时WebSocket流式传输

WER 2.6%意味着每100个单词只有约2-3个错误——与人类打字的错字率相当甚至更低。


两种模式,各有用途

非流式模式:处理预录文件

适用于讲座视频、播客、采访录音等已完成的音频文件。上传文件后,系统按发话自动检测语言并进行转录。

  • 支持85种以上语言
  • 说话人分离(Speaker Diarization):自动区分"A说了什么"和"B说了什么"
  • 词级时间戳:记录每个单词在哪个时间点被说出
  • 自定义词汇设置:可以指定最多1000个特定术语(人名、产品名、行业专业术语)优先识别

流式模式:实时对话

在Live API上运行的实时流式传输。通过WebSocket连接,说话的同时文字就会生成。

  • 同时返回中间结果(interim)和最终结果(finalized)
  • 智能转录模式:自动整理填充语("嗯..."、"那个...")和重复内容
  • 支持多种语音活动检测(VAD)策略

发话级语言检测:多语言内容的救星

这个功能尤其引人注目。它不是对整个录音文件进行语言检测,而是按发话进行语言检测。

例如,一方用中文说话、另一方用英文说话的采访文件上传后,系统会对每个发话自动检测语言并用相应语言转录。在国际学术会议、全球团队会议、多语言社区的录音资料处理上,这是一个强大的工具。


教育场景中的实用建议

从教育技术角度,列举三个最实用的应用场景:

1. 讲座自动字幕生成 教师录制视频后,将音频文件提供给Gemini 3.5 Transcribe,就能自动生成带时间戳的字幕数据,省去了手动编辑字幕的工作。

2. 学生演讲评估辅助 录制学生演讲后进行转录,可以基于文本提供反馈或辅助评分。开启说话人分离功能后,还可以在小组演讲中测量每位学生的发言量。

3. 多语言学生支持 母语非目标语言的学生用母语回答的内容可以被转录,教师结合翻译工具理解内容。


自定义词汇功能:避免专有名词的陷阱

AI语音识别始终面临挑战的领域:人名、品牌名、技术术语、地区特有词汇。

Gemini 3.5 Transcribe可以指定最多1000个自定义词汇(Custom Vocabulary)。将一般语言模型不熟悉的词汇加入列表,系统就会优先识别这些词汇。


费用与使用方法

通过Gemini API访问。可以直接在Google AI Studio中测试,商业使用遵循Google Cloud AI的定价体系。目前处于GA(正式发布)状态。

开始使用很简单:

  1. Google AI Studio → 获取Gemini API密钥
  2. 向gemini-3.5-transcribe模型端点发送音频文件
  3. 需要实时流式传输时,通过WebSocket连接gemini-3.5-transcribe-live

总结

Gemini 3.5 Transcribe将语音识别从"勉强够用"提升到了"可以信任"的水平。特别是在多语言环境、专业术语较多的领域以及需要实时转录的服务中,它可以成为改变游戏规则的工具。

随着语音转文字技术成为教育内容制作和学习支持的基础设施,准确捕捉语音本身就是教育可及性的问题。


Sources:

Gemini 3.5 Transcribe:85种语言,错误率2.6% — 谷歌重新定义语音识别标准 | MINSSAM.COM