記事一覧へ戻る
マルチモーダル

Gemini 3.8 Live、リアルタイムアバターで企業対話を可視化

読了目安 3 分

概要

Google DeepMindは、Live Avatarを備えたGemini 3.8 Liveを発表した。これは、リアルタイムの音声対話モデルに低遅延の動画生成を組み合わせ、企業向けエージェントに視覚的な存在感を与える機能だ。従来の音声だけのアシスタントとは異なり、ユーザーの音声や映像を受け取り、声、表情、口の動きを伴う映像で応答する。

主なポイント

  • マルチモーダルな会話:音声と視覚入力を同時に処理し、自然な表情、リップシンク、滑らかな発話の交代を目指す。カスタマーサポートや案内業務で、音声ボットよりも対面に近い体験を作る狙いがある。
  • 会話を止めないツール実行:非同期のツール呼び出しにより、データ取得や業務処理をバックグラウンドで進めながら会話を続けられる。公式例では、ホテルのチェックイン処理中も対話を維持する様子が示されている。
  • 97言語に対応:音声から音声への多言語同期に対応し、会話中に言語が変わっても口の動きや表情を調整する。Googleは、切り替え時の動画品質低下や視覚的なずれを抑えるとしている。
  • ブランド向けアバター:プリセットのアバターに加え、高品質な参照画像からカスタムアバターを生成できる。外見の類似性、ブランドのスタイル、キャラクター性を保つ設計だが、現時点では企業の許可リスト経由に限られる。
  • 生成コンテンツの識別:出力される音声と動画には、検出可能性を高める不可視のSynthID透かしが組み込まれると説明されている。

意味と影響

Live Avatarの重要性は、単にAIに顔を付けたことではない。視覚的な反応を会話の一部として扱い、顧客対応、製品デモ、研修、操作案内などで情報を伝える方法を広げる点にある。表情や口の動きが音声と一致すれば、長い説明でも状況を把握しやすくなる可能性がある。

非同期ツール実行も企業導入に直結する。社内システムへの照会や業務処理に時間がかかる場合、無言の待ち時間を減らせるためだ。一方で、権限管理、処理失敗時の説明、回答の不確実性をどう示すかは企業側の課題になる。

視覚的な人格には、ユーザーが能力を過大評価したり、実在人物と誤認したりするリスクもある。SynthIDは出所確認を支えるが、AIであることの表示や利用ルールを置き換えるものではない。

この機能はGemini Enterpriseで提供され、開発者はAPIドキュメントから利用を始められる。今回の発表は、企業AIが「回答する存在」から、処理中も目に見える形で対話を続けるエージェントへ進む方向を示している。

出典:Google DeepMind

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
PrismML、1ビット小型モデルをQualcomm製スマートグラス向けに展開
マルチモーダル
cctest.ai
マルチモーダル

PrismML、1ビット小型モデルをQualcomm製スマートグラス向けに展開

PrismMLは、QualcommのSnapdragon AR1 Gen 1 Platformを搭載するスマートグラス向けに、1ビットのBonsai言語モデルを披露した。約20億パラメータの視覚言語モデルで、端末上の処理を目指すが、搭載製品はまだ発表されていない。

続きを読む
CCTest · Blog
Ovis-Embedding、テキスト・画像・動画・音声を一つの意味空間へ
マルチモーダル
cctest.ai
マルチモーダル

Ovis-Embedding、テキスト・画像・動画・音声を一つの意味空間へ

Ovis-Embeddingは、共有マルチモーダル・バックボーンでテキスト、画像、動画、音声を処理するオムニモーダル埋め込み方式を提案する。データ構成、難例学習、類似度蒸留、推論時の次元調整までを一体で設計している。

続きを読む
CCTest · Blog
Realtime-Venus、非同期委任に対応する全二重インタラクションを提案
マルチモーダル
cctest.ai
マルチモーダル

Realtime-Venus、非同期委任に対応する全二重インタラクションを提案

Realtime-Venus は、会話を継続しながらバックグラウンドで推論やツール実行を進めるリアルタイム対話システムです。音声・映像向けと音声対話向けに、個別に学習した 9B モデルをそれぞれ備えています。

続きを読む