aiminute. ← AIニュース一覧
新モデル AI Minute Newsroom 2026-08-28

グーグルの新しい文字起こしモデルは、話した内容ではなく言おうとした内容を書く——85言語で

グーグルの新しい文字起こしモデルは、話した内容ではなく言おうとした内容を書く——85言語で

グーグルは Gemini の音声理解を土台にした音声認識モデル Gemini 3.5 Transcribe を公開プレビューとして提供開始した。85を超える言語を自動判別し、文の途中で言語を切り替える話者にも追随し、最大3人の声を区別し、単語単位のタイムスタンプを出力する。通常の口述筆記と異なるのは、グーグルが「スマート文字起こし」と呼ぶ部分だ。フィラー語を取り除き、話者の言い直しを整え、その場で書式を整えるため、出力は音声の逐語記録ではなく整った文章として読める。専門用語のためにカスタム語彙へバイアスをかけることもでき、文字起こしの途中で関数呼び出しによりタスクを引き渡すこともできる。グーグルが示す単語誤り率は、録音音声で2.6パーセント、ストリーミングで4.0パーセント。多言語ベンチマーク FLEURS ではそれぞれ5.04パーセントと5.50パーセントで、レイテンシは前世代の Chirp 3 に比べ約70パーセント低いという。利用は Google AI Studio と Gemini Enterprise Agent Platform の Gemini API 経由のほか、Android の Gboard Rambler、macOS 版 Gemini アプリでも可能で、Chrome への対応も予定されている。

なぜ重要か文字起こしは多くの平凡な仕事の下を走る配管だ。講義ノート、医療口述、字幕、議事録、記者が起こさねばならないインタビュー。コードスイッチングを含む85言語対応は、英語圏の外で本当に効く一行である。ほとんどの人は一度の会話で一つの言語をきれいに話し切らないのに、これまでのモデルはそれをうまく扱えなかった。ただし整形は正真正銘の取引でもある。あなたの文を黙って直す記録は読みやすいが、話された内容の忠実な記録ではなくなる。それは供述調書や懲戒審問にとって、まさに持ってはいけない性質だ。
#音声・音楽

✓ 検証済み · 4ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

グーグルの動画モデルに、ショットの始点と終点を指定できるようになった——下書きのコストは3分の1
2026-08-28
オーストラリアのチャート、曲は人が書きリードボーカルは人が歌うことが条件に——金曜施行
2026-08-27
開発者が数週間つついていた匿名モデルがMITライセンスで公開に——Z.aiは「プレビューはすべて中国製チップで動かした」と主張
2026-08-27
IBMの新しいオープンモデルは、端末の使い方を教わったのではない。実際に端末を使って鍛えられた
2026-08-27
レコード会社が AI 画像企業に出資した——ユニバーサル、ソニー、ワーナー、EA が Stability の7600万ドル調達に名を連ねる
2026-08-26