記事一覧へ戻る
音声・オーディオ

Gemini 3.8 Live登場、会話しながらタスクを実行する音声AIへ

読了目安 3 分

概要

音声AIの評価軸は、発話を認識できるかどうかから、会話を続けながら実際の仕事を進められるかへ移りつつあります。Google DeepMindが発表したGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingは、この方向を意識したリアルタイム音声モデルです。前者は大規模展開に向く応答速度とコスト効率、後者は複雑な推論と多段階タスクを重視しています。

主なポイント

  • 自然な対話と視覚理解:Gemini 3.8 Liveはほぼリアルタイムで視覚入力を処理し、ユーザーが見せている対象を会話の文脈として利用できます。また、会話中に97言語を自動検出して切り替えられるとされています。
  • 話しながらバックグラウンド実行:ツールやAPIを呼び出している間も、モデルは会話を継続できます。依頼を受けたことを伝え、確認事項を尋ねながら、予約や検索などの非同期処理を進める構成です。
  • 複雑な処理向けの推論:Extended Thinkingは多段階ワークフローを対象にしています。「確認します」といった早い反応や処理状況の説明によって、作業中の無言時間を減らします。
  • 幅広い利用例:Googleは、従業員のオンボーディング、Search上のトラブル解決、チェス、スケッチからのReactコンポーネント生成、事業計画やマーケティングツールの作成などを紹介しています。
  • 開発基盤との連携:Gemini Live APIは、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsなどのプラットフォームと連携し、リアルタイムメディア処理の構築を支援します。

性能と提供状況

Googleによると、Gemini 3.8 Live Extended ThinkingはArtificial AnalysisのSpeech to Speech Quality Indexで82.6を記録しました。τ-Voiceでは68.6%、Sierraのτ-Voice-bankingでは35.1%、BigBench Audioでは97.7%とされています。Gemini 3.8 LiveはSpeech Agent Arenaで高いユーザー評価を得たと説明されています。いずれも公式発表に基づく数値であり、実際の結果はタスク、遅延、ツール連携、導入環境によって変わります。

両モデルはGemini APIとGoogle AI Studioから利用が始まり、企業向けにはプレビュー提供が進められています。Search Live、Gemini Live、Workspaceの一部機能にも順次展開されます。Googleは、AI製品が生成する音声に検出を支援する不可視のSynthID透かしを組み込むとしています。

意義と影響

今回の重要点は、音声AIを単なる質問応答の窓口から、共同作業の入口へ近づけたことです。視覚的な状況理解、バックグラウンド処理、並列推論を組み合わせれば、ユーザーは会話を止めずに作業を進められます。

カスタマーサポート、研修、現場支援、企業内業務などでの活用が期待されますが、実運用ではベンチマーク以外の条件も重要です。応答の正確性、ツール呼び出しの制御、プライバシー、監視機能、遅延、コストが、音声エージェントを継続的に信頼できるかを左右するでしょう。

出典:Google DeepMind

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
X-AuT、段階的蒸留で音声LLMの音声エンコーダーを圧縮
音声・オーディオ
cctest.ai
音声・オーディオ

X-AuT、段階的蒸留で音声LLMの音声エンコーダーを圧縮

X-AuTは、音声大規模言語モデルの音声エンコーダーを段階的に圧縮するフレームワークです。行動プローブと表現アライメント、クロススケール蒸留を組み合わせ、剪定後に起きる文字欠落や早すぎる終了を抑えます。

続きを読む
CCTest · Blog
小米、聞きたい話者に絞る音声認識モデル「CocktailASR-1」を公開
音声・オーディオ
cctest.ai
音声・オーディオ

小米、聞きたい話者に絞る音声認識モデル「CocktailASR-1」を公開

小米が、複数人の発話が重なる環境を対象とした産業級のターゲット話者音声認識モデル、CocktailASR-1をオープンソース化しました。単純なノイズ除去ではなく、先に聞きたい話者を指定し、その人物の発話だけを認識するアプローチです。

続きを読む
CCTest · Blog
脳信号を意味経由で文字へ:非侵襲音声デコーディングの新しい設計
音声・オーディオ
cctest.ai
音声・オーディオ

脳信号を意味経由で文字へ:非侵襲音声デコーディングの新しい設計

Brain2Semantics2Textは、文レベルのMEG応答をまず意味埋め込み空間へ写像し、その後に自然言語へ変換する。音素や単語を逐一復元する代わりに、文全体の意味を優先するアプローチだ。

続きを読む