Google DeepMind が Gemini 3.5 Transcribe を投入 ── WER 2.6%の高精度と機能呼び出し
音声認識で「うーん」「あの」を消すだけで終わらない、次世代の書き起こしだ。Google DeepMind が公開した Gemini 3.5 Transcribe は、自己修正まで自動で整理し、タスク実行まで繋ぐ設計がかなり面白い。音声UIを開発している人なら、この変化は見過ごせないだろう。
▸何が変わったのか
従来の音声認識モデルが苦手とする背景ノイズや専門用語、話し言葉の整理を一気に処理する。Artificial Analysis による測定で、ストリーミング時 WER 4.0%、非ストリーミング時 WER 2.6% という高精度を実現している。さらに、「水曜でないと」「いや、木曜だ」といった自己修正や、不要なフィラー(間投詞)の除去、テキストの自動整形を標準装備。85言語以上の自動検出に対応し、カスタム語彙による専門用語認識も可能になった。
◈前モデル / 競合との比較
従来の Gemini Audio 系モデルや一般的な音声認識 API と比べ、自己修正処理やカスタム語彙への適応力が大きく向上している。Artificial Analysis のデータでは、非ストリーミング時の WER 2.6% は業界トップクラスの精度を示しており、特にアルファベット混在エンティティ(郵便番号や注文IDなど)の認識精度が高い点が特徴。
◈技術背景と意義
従来の音声認識は「音」を「文字」に変換するだけだったが、このモデルは意味理解まで組み込んでいる。例えば、話者が言い直した場合は最終的な意図を判定して正しく書き留める。また、単なる文字起こしに留まらず、画像生成やファイル解析などの複雑なタスクを他の Gemini モデルに委ねる「Function calling」に対応している。これにより、音声入力が単なるメモ取りではなく、実作業のトリガーとして機能する。
▸こんな人・用途に
リアルタイム字幕ツールや音声エージェントの開発者。会議録や通話ログの自動分析パイプライン構築担当者。専門用語が多い業界(医療、法律、IT)で、正確な文字起こしと整形を自動化したいユーザー。
▸Hacker Newsの反応
正直、かなり静か。スコア9、コメント1という過小評価っぷりから、熱狂よりも「待ってました」感が薄い現状を映し出している。
「Chromeでの音声入力が「Talk to type」で強化されるという発表内容を引用。Webフォームでの音声による返信やプロンプト入力への言及をしている。」
◆入手方法・リンク
Gemini API (Google AI Studio) および Gemini Enterprise Agent Platform で利用可能。リアルタイム用途は Live API の ‘gemini-3.5-transcribe-live’、録音済み音声用途は Interactions API の ‘gemini-3.5-transcribe’ を使用する。
▸Redditの反応
正直なところ、反応はかなり地味で「祝」の一言と技術的な指摘が数件ある程度。期待感よりも、動作確認や決済周りの具体的な質問が中心の、静かな空気感です。
「「https://giz.ai/api/signIn がタイムアウトしてるんだけど」と、アクセス時のエラー報告。」
「ベータ公開おめでとう。クールな機能がいろいろあるね、と祝福コメント。」
「ローンチおめでとう。Stripeのアカウント作成直後に何か問題あった?と決済周りを確認。」
SOURCE: Google DeepMind (2026-08-26)


