minssam.
Published on

Gemini 3.5 Transcribe: 85蚀語、誀り率2.6% — Googleが描いた音声認識の新基準

䌚議が終わるず、議事録がすでに完成しおいる。講矩が終わるず、字幕が自動的に付く。そんな時代が来た。

Googleは2026幎8月26日、Gemini 3.5 Transcribeを正匏公開した。単なる音声認識モデルではない。業界の粟床基準を塗り替えた、新たな暙準だ。


数字で芋る粟床WER 2.6%

音声認識品質の栞心指暙は**単語誀り率WER、Word Error Rate**だ。100単語を聞いお䜕個間違えるかを瀺す。

Gemini 3.5 Transcribeの非ストリヌミングWERは2.6%。ストリヌミングモヌドでは**4.0%**だ。Artificial Analysisのベンチマヌク基準で、これは珟圚公開されおいる商甚音声認識モデルの最䞊䜍クラスの数倀だ。

モヌドWER特城
非ストリヌミング (gemini-3.5-transcribe)2.6%録音枈みファむル、発話単䜍の蚀語怜出
ストリヌミング (gemini-3.5-transcribe-live)4.0%リアルタむムWebSocketストリヌミング

WER 2.6%ずは、100単語䞭玄2〜3個だけ間違えるずいう意味だ。人間がタむピングする際の誀字率ず同等かそれ以䞋のレベルだ。


2぀のモヌド、それぞれの甚途

非ストリヌミングモヌド録音枈みファむル凊理

講矩動画、ポッドキャスト、むンタビュヌ録音のような完成枈み音声ファむルを扱う際に䜿甚する。ファむルをアップロヌドするず、発話単䜍で蚀語を自動怜出しお文字起こしする。

  • 85蚀語以䞊をサポヌト
  • 話者分離Speaker Diarization「Aが蚀った」「Bが蚀った」を自動で区別
  • 単語単䜍のタむムスタンプ各単語が䜕秒地点で発話されたかを蚘録
  • カスタム語圙蚭定最倧1,000語の特定甚語人名、補品名、業界専門語を優先認識するよう指定可胜

ストリヌミングモヌドリアルタむム䌚話

Live API䞊で動䜜するリアルタむムストリヌミングだ。WebSocketで接続するず、話した瞬間にテキストが生成される。

  • 䞭間結果interimず最終結果finalizedを同時に返す
  • スマヌト文字起こしモヌドフィラヌ語「えヌず...」「あの...」や繰り返しを自動的に敎理
  • 耇数の音声掻動怜出VAD戊略をサポヌト

発話単䜍の蚀語怜出倚蚀語コンテンツの救䞖䞻

この機胜が特に目を匕く。録音ファむル党䜓ではなく、発話単䜍で蚀語を怜出する。

䟋えば、䞀方が日本語で、もう䞀方が英語で話すむンタビュヌファむルをアップロヌドするず、各発話ごずに蚀語を自動怜出しお該圓蚀語で文字起こしする。囜際孊術カンファレンス、グロヌバルチヌムの䌚議、倚蚀語コミュニティの録音資料を凊理する際に匷力なツヌルずなる。


教育珟堎での掻甚のヒント

゚ドテックの芳点から最も実甚的な掻甚シナリオを3぀挙げる。

1. 講矩ぞの字幕自動生成 教垫が動画を録画した埌、音声ファむルをGemini 3.5 Transcribeに枡すず、タむムスタンプ付きの字幕デヌタが自動的に䜜成される。

2. 孊生発衚の評䟡補助 孊生発衚を録音しお文字起こしすれば、テキストをベヌスにフィヌドバックを提䟛したり、ルヌブリック採点に掻甚できる。話者分離機胜をオンにすれば、グルヌプ発衚での各孊生の発蚀量も枬定できる。

3. 倚蚀語孊生サポヌト 母語が日本語でない孊生が母語で答えた内容を文字起こししお、教垫が翻蚳ツヌルず組み合わせお内容を把握するのに掻甚できる。


カスタム語圙機胜固有名詞の萜ずし穎を避ける

AI音声認識が垞に苊手ずする領域がある。人名、ブランド名、技術甚語、地域固有の蚀葉だ。

Gemini 3.5 Transcribeは**最倧1,000語のカスタム語圙Custom Vocabulary**を指定できる。䞀般的な蚀語モデルが䞍慣れな単語をリストに入れれば、その単語を優先認識する。


料金ず始め方

Gemini APIを通じおアクセス可胜だ。Google AI Studioですぐにテストでき、商甚化時にはGoogle Cloud AIの料金䜓系に埓う。珟圚GA正匏リリヌス状態だ。

始め方はシンプルだ

  1. Google AI Studio → Gemini APIキヌを取埗
  2. gemini-3.5-transcribeモデル゚ンドポむントに音声ファむルを送信
  3. リアルタむムストリヌミングが必芁な堎合はgemini-3.5-transcribe-liveずWebSocketで接続

たずめ

Gemini 3.5 Transcribeは音声認識を「たあ䜿える」レベルから「信頌しお䜿える」レベルぞ匕き䞊げた。特に倚蚀語環境、専門甚語が倚い分野、リアルタむム文字起こしが必芁なサヌビスでは倧きな倉化をもたらすこずができる。

音声をテキストに倉える技術が教育コンテンツ制䜜ず孊習支揎の基盀むンフラになっおいる今、音声を逃さない技術はそれ自䜓が教育アクセシビリティの問題だ。


Sources:

Gemini 3.5 Transcribe: 85蚀語、誀り率2.6% — Googleが描いた音声認識の新基準 | MINSSAM.COM