記事一覧へ戻る
マルチモーダル

Ex-Omni-2D:視覚的な存在感を持つマルチモーダル対話モデル

読了目安 2 分

導入

多モーダル対話モデルは、画像や音声、テキストを理解し、音声で応答するところまで到達しています。しかし、多くのシステムは“話せる”一方で、“そこにいる”感じが弱いままです。Ex-Omni-2Dは、この視覚的な存在感の欠如を埋めることを狙ったフレームワークです。

主要ポイント

  • 応答を三層で生成:テキスト、個別化された音声、参照条件付き動画をまとめて生成します。
  • 先に構想を作る:多モーダル質問、参照画像、参照音声を入力として、まず Visual Thought Plan(VTP) を生成し、場面・感情・動きを構造化します。
  • 音声と動画の共通インターフェース:マルチコードブックの音声単位を共通表現として使い、音声への復号と動画フレームとのオンライン整合を可能にします。
  • 大規模な四元教師信号への依存を軽減:対話、音声、アバター動画の異種データをまたいで学習できるため、巨大な query-text-speech-video 監督に強く依存しません。
  • ストリーミング生成の蒸留:フルシーケンスの Video Generator を教師として用い、少数ステップの block-causal Streaming Student に蒸留します。Prefix Streaming により、チャンク間でよりクリーンな潜在表現を引き継ぎ、後半の品質劣化を抑えます。

意義

この研究の面白さは、単に動画を足したことではなく、対話モデルを“身体を持つ存在”に近づけている点にあります。返答が音声だけでなく、表情や動き、視線のニュアンスまで伴うなら、仮想アシスタントやインタラクティブなアバターの体験は大きく変わります。

また、四段階推論と四GPU構成での実時間性も示されており、研究段階の概念提案にとどまらず、実装可能性にも目配りされています。今後この方向が進めば、マルチモーダル対話は“聞いて答える”段階から、“見えて伝わる”段階へ移るかもしれません。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
画像編集AIは「次に何を直すか」を画像を見て提案する段階へ
マルチモーダル
cctest.ai
マルチモーダル

画像編集AIは「次に何を直すか」を画像を見て提案する段階へ

画像生成チャットにおける次の編集提案は、会話テキストだけでなく現在の画像に基づく必要がある。論文は、実利用データ、クリックフィードバック、視覚検証器を組み合わせた三段階フレームワークを提案している。

続きを読む
CCTest · Blog
Evidence-RL:VLMに「画像証拠にもとづく回答」を促す新手法
マルチモーダル
cctest.ai
マルチモーダル

Evidence-RL:VLMに「画像証拠にもとづく回答」を促す新手法

Evidence-RL は、視覚言語モデルが正答していても、その根拠が本当に画像内の証拠にあるのかを問い直す研究です。CED により、局所的な視覚証拠と回答の因果的な依存関係を訓練時に監査します。

続きを読む