打ち合わせを録って文字起こしにかけると、たいてい「えー」「あの」「えーっと」がびっしり並ぶ。言い直しもそのまま拾うから、最初の一言と直したあとの一言が二重に残る。これを人が消して清書するのに、30分の会議でも20〜30分かかる。結局「録っても後回し」になり、議事録は誰かの記憶頼みに戻る。群馬の現場でよく見る光景です。

2026年8月26日(米国時間)、Googleが新しい音声認識モデル「Gemini 3.5 Transcribe」を発表しました。売りは精度だけではありません。フィラーや言い直しを、話し手の意図をくんで自動的に整える。つまり「録音を清書に近い形で返す」方向に振ってきたモデルです。ただし今の提供形態には注意点があるので、そこも含めて実務目線で整理します。

何が変わったのか

グラスグリーンを基調にした概念図。左から右へ流れる音声の波形。途中でざらついたノイズの粒や小さなトゲが漉し取られ、なめらかで整った一本の帯に変わっていく様子。文字や数字は描かない。

まず精度。単語誤り率(WER=書き起こした単語のうち間違えた割合)は、用途によって数値が分かれます。録音をまとめて処理する非ストリーミングで2.6%、リアルタイムのストリーミングで4.0%。従来のChirp 3系から大きく下げてきました。片方だけを見て「2.6%のモデル」と丸めると、リアルタイム用途では実際とずれます。使う場面がどちらかを先に決めてから数値を見てください。

もう一つが言語対応。85言語以上を自動で判別します。話し始めに言語を指定しなくても拾う設計です。

「あー」「えーっと」を消して、言い直しも整える

このモデルの実務的な肝は、フィラーと言い直しの処理にあります。「あの、えー、その件は」を素の音のまま文字化するのではなく、意図をくんで「その件は」へ整える。背景ノイズや言い間違いもならして、人の編集者が一度直したような清書に近づけます。

効くのは、きれいに話す前提が崩れる場面です。工場の立ち話、現場での指示、思いつきを口に出しただけのメモ。こうした言い淀みの多い音声こそ、これまで清書コストが高かった。そこを機械側が下ごしらえしてくれるなら、口頭メモをそのまま議事録の下書きに回せる射程が見えてきます。

これまで当社が中小企業の議事録運用を見てきた限り、つまずくのは「録音」ではなく「清書」の工程でした。録るのは1タップでも、フィラーを消して読める文にする手作業が残るから続かない。その手作業を削るモデルが出た、という受け止めが実態に近いです。

リアルタイムと録音で、APIが分かれている

グラスグリーンを基調にした概念図。左にマイクから伸びるリアルタイムの音声の流れ、右に積まれた録音ファイルの束。二つの入り口がそれぞれ別の経路をたどり、整った書き起こしの帯へ合流していく対比。文字や数字は描かない。

提供APIは2種類で、想定する使い方が違います。用途を取り違えると、レイテンシや話者識別の有無で「思っていたのと違う」が起きます。

  • Live API(gemini-3.5-transcribe-live): リアルタイム向け。字幕表示や口述筆記など、話しながら文字にしたい場面。サブ秒のレイテンシで返す。
  • Interactions API(gemini-3.5-transcribe): 録音向け。最大3人までの話者を識別し、単語単位のタイムスタンプを付ける。あとから議事録に起こす、発言者ごとに整理する用途に合う。

議事録なら基本は後者。誰が何を言ったかで整理でき、音声のどこを言ったかも単語レベルでたどれます。少人数の打ち合わせなら3人までの識別で足りる場面は多いはずです。

ただし今は「プレビュー提供」。導入前の線引き

グラスグリーンを基調にした概念図。半分だけ開いたシャッターの向こうに、整った書類が並ぶ棚がうっすら見える。手前には機密を伏せるための一枚の目隠しシート。「準備中・順次ひらいていく」を思わせる構図。文字や数字は描かない。

ここを外すと判断を誤ります。提供状況は一括りにできません。開発者・企業がAPIで使う分はプレビュー提供(public preview)で、一般提供(GA)ではありません。一方で、macOS版のGeminiアプリ(英語)と、対象の国・言語でのAndroidのGboard「Rambler」では、すでに利用できると公式が案内しています。自分の使い方がどの入り口かで、いま触れるかどうかが変わります。

公式が挙げる提供先は、AndroidのGboard(Rambler)、Antigravity、Google AI Studio、macOS版Geminiアプリ、そして今後のChromeです。各種の文字起こしアプリの精度を底から押し上げる基盤モデル側の更新、という位置づけで捉えるのが正確です。だから「どのアプリを選ぶか」の話とは層が違います。土台の精度が上がる話です。

そのうえで、中小企業が今できることは実験です。自社の議事録運用のどこが詰まっているかを1業務で切り出し、プレビューのうちに手触りを確かめる。ただし外部サービスへ音声を送る以上、取引先名・個人情報・金額を含む録音は、投入前に伏せるか区間を分ける。出てきた清書も、金額や決定事項は人が原本の音声と突き合わせて最終確認する。ここはモデルが賢くなっても人の工程として残します。

まとめ

  • Gemini 3.5 TranscribeはWER非ストリーミング2.6%/ストリーミング4.0%。フィラーと言い直しを整えて、録音を清書に近い形で返す。
  • APIはリアルタイムのLive APIと、録音向けで最大3人の話者識別+単語タイムスタンプが付くInteractions APIの2種。議事録は後者が軸。
  • API提供はプレビューでGAではないが、macOS版Geminiアプリ(英語)と対象地域のAndroid Ramblerはすでに利用可能。基盤モデルの精度が上がる話として捉え、1業務で試しながら機密の扱いと人の最終確認は残す。

出典: Google公式ブログ「Gemini 3.5 Transcribe」/窓の杜の報道

議事録の「清書の詰まり」を一緒にほどきます

ククルデザインは群馬の中小企業向けに、AIの業務導入を小さく始めて効果を測る伴走をしています。「打ち合わせは録っているのに議事録が続かない」なら、まずどの1業務から音声を清書に回すか、前後の作業時間を測るところからご一緒します。プレビュー段階の技術も、機密の扱いと確認工程を設計したうえで安全に試せます。お気軽にご相談ください。