記事一覧へ戻る
マルチモーダル

Ex-Omni-2D:視覚的な存在感を持つマルチモーダル対話モデル

読了目安 2 分

導入

多モーダル対話モデルは、画像や音声、テキストを理解し、音声で応答するところまで到達しています。しかし、多くのシステムは“話せる”一方で、“そこにいる”感じが弱いままです。Ex-Omni-2Dは、この視覚的な存在感の欠如を埋めることを狙ったフレームワークです。

主要ポイント

  • 応答を三層で生成:テキスト、個別化された音声、参照条件付き動画をまとめて生成します。
  • 先に構想を作る:多モーダル質問、参照画像、参照音声を入力として、まず Visual Thought Plan(VTP) を生成し、場面・感情・動きを構造化します。
  • 音声と動画の共通インターフェース:マルチコードブックの音声単位を共通表現として使い、音声への復号と動画フレームとのオンライン整合を可能にします。
  • 大規模な四元教師信号への依存を軽減:対話、音声、アバター動画の異種データをまたいで学習できるため、巨大な query-text-speech-video 監督に強く依存しません。
  • ストリーミング生成の蒸留:フルシーケンスの Video Generator を教師として用い、少数ステップの block-causal Streaming Student に蒸留します。Prefix Streaming により、チャンク間でよりクリーンな潜在表現を引き継ぎ、後半の品質劣化を抑えます。

意義

この研究の面白さは、単に動画を足したことではなく、対話モデルを“身体を持つ存在”に近づけている点にあります。返答が音声だけでなく、表情や動き、視線のニュアンスまで伴うなら、仮想アシスタントやインタラクティブなアバターの体験は大きく変わります。

また、四段階推論と四GPU構成での実時間性も示されており、研究段階の概念提案にとどまらず、実装可能性にも目配りされています。今後この方向が進めば、マルチモーダル対話は“聞いて答える”段階から、“見えて伝わる”段階へ移るかもしれません。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AV-GRPO、音声・映像生成の強化学習をモダリティ別に分解
マルチモーダル
cctest.ai
マルチモーダル

AV-GRPO、音声・映像生成の強化学習をモダリティ別に分解

AV-GRPO は、音声と映像を同時に生成する拡散モデルで問題になる報酬の混在、計算コスト、同期評価の難しさに取り組む手法です。5DAV データセットは、学習難度を制御しながらサンプルを複数の次元に分解します。

続きを読む
CCTest · Blog
PrismML、1ビット小型モデルをQualcomm製スマートグラス向けに展開
マルチモーダル
cctest.ai
マルチモーダル

PrismML、1ビット小型モデルをQualcomm製スマートグラス向けに展開

PrismMLは、QualcommのSnapdragon AR1 Gen 1 Platformを搭載するスマートグラス向けに、1ビットのBonsai言語モデルを披露した。約20億パラメータの視覚言語モデルで、端末上の処理を目指すが、搭載製品はまだ発表されていない。

続きを読む