AI PICKS
新登場Google DeepMind Blog公式発表9/3 更新

Google、Gemini 3.5 Transcribeを発表 85超の言語を自動検出

結論(先に3行)
  1. Google DeepMindがGemini 3.5 Transcribeを発表しました。
  2. リアルタイムと録音音声向けの2つのAPIで提供します。
  3. 85超の言語検出や最大3人の話者識別に対応します。
画像: Google DeepMind Blog

Google DeepMindは2026年8月26日、音声テキスト変換モデル「Gemini 3.5 Transcribe」を発表しました。自然な発話を、正確で整った書式付きテキストへ変換するモデルです。

開発者はGemini APIを通じて、Google AI StudioとGemini Enterprise Agent Platformで利用できます。Live APIではgemini-3.5-transcribe-liveを使い、サブ秒レイテンシの双方向ストリーミングを提供します。Interactions APIではgemini-3.5-transcribeを使い、録音音声や会議、通話ログを処理します。

機能面では、言い直しの処理、フィラー語の削除、自動整形、カスタム語彙への対応を備えます。Artificial Analysisの測定では、平均Word Error Rateはストリーミングで4.0%、非ストリーミングで2.6%です。

85超の言語を自動検出して文字起こしし、地域アクセントや多様な方言も扱います。録音音声では単語単位のタイムスタンプと最大3人の話者識別に対応し、3人を超える話者の対応は実験的です。前モデルChirp 3と比べ、最終文字起こしまでの時間は70%改善しました。

つまり、どういうこと?

つまり、話し言葉をそのまま清書してくれる文字起こしです。「火曜、いや水曜で」と言い直しても直った側だけが残り、「えーと」のような口癖も消えます。

会議の録音なら、誰が話したかを3人まで分けて、単語ごとに時間も付きます。人間の書記が横で整えてくれるイメージです。

編集部の見方AI PICKS編集部

筆者が目を引かれたのは、精度そのものより先に「言い直しの処理」や「フィラー語の削除」が並んでいたことです。文字起こしの不満は、誤字よりも読み返す気が失せる冗長さにあります。そこを引き受ける設計。

ただ、話者識別が3人までというのは、会議用途だとちょっと物足りません。3人を超えると実験的な扱いなので、議事録づくりを丸ごと任せたい人にはまだ早い段階という印象です。

一方、最終テキストが出るまでの時間が70%縮んだのは、音声で操作するアプリには効きます。コンマ数秒の差で、話しかける気になるかどうかが変わりますから。近くChromeでも入力欄に話しかけられるようになるので、そこで日本語の言い直しがどこまで自然に消えるかを見たいです。

誰に関係するか

音声エージェント、リアルタイム字幕、会議や通話ログ分析を開発する人に関係します。

出典: Google DeepMind Blog

このニュースのツールAIチャットボット
Gemini icon
Gemini4.65最低料金¥0〜マルチモーダルGoogle連携検索
この発表の背景AI PICKS編集部

Geminiは、Googleが提供する対話型AIアシスタントで、質問への回答、文章作成、要約、アイデア出しをチャット形式で支援するAIチャットボットです。

AI PICKSの総合評価は4.65(5点満点)、AIチャットボットカテゴリ88ツール中2位、最低料金は¥0〜です。

同じ用途の候補: ChatGPTClaudePerplexity

関連ニュースニュース一覧 >
法人の方へGeminiの法人導入、無料相談セキュリティ要件・学習不使用の契約・研修まで、条件に合う候補を絞ってお返しします。相談料・紹介料は無料。