概要
Gemini 3.5 Transcribe は、Googleが開発した最新の 音声認識モデル。 雑音や専門用語にも強く、正確な文字起こし を実現。 リアルタイムと録音音声 の両方に対応し、 開発者や企業、一般ユーザー 向けに提供。 85以上の言語、カスタム語彙やマルチスピーカー識別 にも対応。 Gemini APIや各種Googleサービス で利用可能。
Gemini 3.5 Transcribe:最先端音声認識モデルの紹介
- Gemini 3.5 Transcribe は、 精度と知能性 を重視した音声からテキストへの変換モデル
- 従来の音声認識 が苦手とする 雑音、専門用語、話し言葉の修正 にも高精度対応
- 生音声を直接、 整形済みの正確なテキスト に変換
- GeminiアプリやAndroid など、既に多くのGoogle製品で活用実績
- 開発者向け には、 Gemini API(Google AI Studio) や Gemini Enterprise Agent Platform でAPI提供
利用可能なAPIと用途
- リアルタイムストリーミング (Live API:gemini-3.5-transcribe-live)
- 双方向ストリーミング と サブ秒レイテンシ で対話型音声アプリに最適
- 録音音声処理 (Interactions API:gemini-3.5-transcribe)
- 会議録音や通話ログ の文字起こし、 話者識別 や 単語単位のタイムスタンプ 付与
主な特徴と技術的進化
- スマート文字起こし 機能
- 自己修正やフィラー除去 (例:「えー」「あのー」)・ 自動整形 対応
- ファンクションコール による他Geminiモデルとの連携
- 画像生成やファイル解析 などの複雑タスクも音声で実行
- 高精度な認識率
- ストリーミングWER:4.0%、 非ストリーミングWER:2.6% (Artificial Analysis調査)
- 雑音環境や英数字認識 にも強み
- カスタム語彙サポート
- 専門用語や固有名詞 も柔軟に認識
- 85以上の言語対応
- 方言やアクセント にも適応
- マルチスピーカー識別
- 最大3名まで の話者識別(3名超は実験段階)
旧モデルChirp 3からの進化
- 新機能追加、WERの大幅改善、レイテンシ70%短縮
- FLEURSベンチマーク でも多言語で高精度を証明
- ストリーミングWER:5.50%
- 非ストリーミングWER:5.04%
各種Googleサービスでの活用例
- Gboard(Android) :Rambler機能で 話し言葉を整形テキストに変換
- Google Antigravity : 画面やチャット履歴の文脈 と連携し、ファイル名やドキュメントも正確に認識
- Google AI Studio : Buildモード で音声によるコーディングも可能
- Geminiアプリ(macOS) : 自然な音声入力やコマンド で複雑な作業も音声で完結
- Chrome(近日公開) :任意のWeb入力欄で 音声入力が可能、Geminiとの連携も強化
デベロッパー/企業/一般ユーザー向け提供状況
- デベロッパー向け :Gemini API(Google AI Studio、Antigravity)でパブリックプレビュー中
- エンタープライズ向け :Gemini Enterprise Agent Platformでパブリックプレビュー、Gemini Enterprise for Customer Experienceにも近日対応
- 一般ユーザー向け :macOS版Geminiアプリ(英語)、Android版Rambler(対象国と言語)、Chrome(近日公開)
主要パートナーとフィードバック
- Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents などの開発者プラットフォームが Gemini Live API を活用
- リアルタイム音声アプリ開発の効率化 を実現
- vivo、Intellitek Health、Lingopal などの企業からも 高評価 (低レイテンシ、高精度、多言語対応)
最新情報の入手方法
- Googleニュースレター で製品アップデートやイベント情報を配信
- 個人情報はGoogleのプライバシーポリシー に従い管理、 いつでも配信停止可能