記事一覧へ戻る
マルチモーダル

Realtime-Venus、非同期委任に対応する全二重インタラクションを提案

読了目安 3 分

背景

一般的な音声アシスタントは、ユーザーが話し終えてから処理し、その後に応答するターン制の設計です。しかし、画面の変化を継続的に観察したり、外部タスクを実行したり、応答中にユーザーが話し続けたりする状況では、この方式は遅延や文脈の分断を招きます。Realtime-Venus は、継続的な知覚、先回りした応答、非同期のタスク委任を一つのリアルタイム対話基盤に統合しようとしています。

二つの 9B モデル

Realtime-Venus には、個別に学習された二つの 9B モデルがあります。Realtime-Venus-Omni は音声・映像対話を対象とし、発話や言語情報を、変化し続ける視覚的な状況と結び付けて扱います。Realtime-Venus-Audio は音声対話に特化し、連続する音声入力の理解とネイティブな音声出力を担います。

両モデルは単なる認識モジュールではありません。継続的な知覚、会話制御、音声生成を一体化した会話フロントエンドとして設計されています。また、ユーザー入力、モデル出力、タスク委任イベントを共通の因果タイムラインに配置します。これにより、ストリーミング入力や割り込み、対話中の文脈更新を同じ時間軸で扱えるようにしています。

会話を止めずにタスクを処理

実行時システムは二重ループで構成されています。前景ループはライブ対話を維持し、バックグラウンドでは Realtime-Venus-Harness が推論やツール実行などの委任タスクを処理します。処理中もユーザーは会話を続けられ、結果が返ると現在進行中の対話へ統合されます。

この構成の重要性は、複雑な処理が即時応答を完全にブロックしない点にあります。一方で、提供された素材には、Harness が利用できる具体的なツール、実運用時のコスト、エンドツーエンドの遅延は記載されていません。そのため、設計上の可能性と、あらゆる環境での実用性は分けて評価する必要があります。

評価結果と意義

論文によると、比較対象となったオンラインモデルの中で、Realtime-Venus-Omni は八つの動画ベンチマークのうち六つで最高スコアを獲得しました。StreamingBench は 70.2%、OVO-Bench は 64.7%、Daily-Omni は 81.3% でした。Realtime-Venus-Audio は音声理解・音声質問応答の八つのベンチマークのうち、MMAU、MMAU-Pro、Llama Questions、Speech CMMLU で比較モデルを上回り、それぞれ 78.0%、63.2%、83.8%、67.8% と報告されています。

学習面では、オフライン理解、能動的な全二重対話軌跡、委任ワークフローを組み合わせた後学習レシピが特徴です。これは、要求に答えるだけのアシスタントから、会話を継続しながら長い処理を協調して進めるフロントエンドへの移行を示します。今後は、割り込み処理、失敗からの回復、ツールの信頼性、端末ごとの遅延が実用性を左右するでしょう。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SpatialBlock、合成ブロック課題で視覚言語モデルの空間知能を訓練
マルチモーダル
cctest.ai
マルチモーダル

SpatialBlock、合成ブロック課題で視覚言語モデルの空間知能を訓練

SpatialBlockは、複雑で高コストな実画像の幾何アノテーションに代わり、合成したブロック積み課題で大規模視覚言語モデルを訓練する手法を提案する。SpatialBlock-15kは、3D投影、視点変換、構造の組み合わせ、色による空間アンカーを扱う。

続きを読む
CCTest · Blog
SenseNova-U1.5、視覚理解と生成を統合する8Bモデル
マルチモーダル
cctest.ai
マルチモーダル

SenseNova-U1.5、視覚理解と生成を統合する8Bモデル

SenseNova-U1.5は、視覚エンコーダーとVAEを使わず、視覚の理解・推論・生成を一体化する8B-MoTモデルです。論文では、画像の忠実度、文字描画、複雑な構図、複数参照画像の編集などの改善が報告されています。

続きを読む