記事一覧へ戻る
マルチモーダル

MOSS-VL、話しながら見続けるリアルタイムVLMを設計

読了目安 3 分

導入

一般的な視覚言語モデルは、画像や動画を入力し終えてから回答を生成するオフライン型です。しかしリアルタイムのアシスタントでは、モデルが話している途中にも新しい映像が届きます。すべてのフレームを待てば応答が遅れ、早く話し始めれば後から得た情報との整合性が課題になります。MOSS-VL Technical Reportは、この「見ながら話す」能力を付加機能ではなく、中心的な設計目標として扱っています。

主な設計

  • ゲート付きクロスアテンションを採用。 言語デコーダーは、生成中のトークン列に視覚トークンを直接追加するのではなく、ゲート付きクロスアテンションを通じて視覚表現を参照します。これにより、生成中も新しいフレームを受け取りやすく、視覚コンテキストがデコード列を直接圧迫することも避けられます。
  • 発話のタイミングを学習。 合成された対話コーパスを使い、いつ自発的に話すべきか、いつ沈黙すべきか、新しい情報を得たときに過去の回答をどう修正するかを指導します。通常の画像質問応答データだけでは、こうした行動は十分に学べません。
  • リアルタイム訓練を最終段階に集約。 まず強力なオフライン基盤で一般的な視覚言語能力を構築し、最後の軽量な段階でリアルタイム固有の訓練を行います。これにより、ストリーミング能力の追加コストを抑えつつ、オフライン性能への影響を抑える狙いです。

評価結果

報告によれば、MOSS-VL-Instructは同程度の規模のオフライン課題で競争力を持ち、時間的推論を測る動画データセットで高い結果を示しました。MOSS-VL-Realtimeは4つのストリーミングベンチマークのうち3つで、オープンソースのストリーミングモデル中、平均スコアが最良でした。残る1つでは2位です。特に自発的な行動を測る3つのサブセットをすべて制し、OmniMMI Proactive Alertingでは66.0点で、報告中の最良ベースライン37.5点を上回りました。

モデルは113億パラメータです。視覚トークンをデコード列の外側で扱うため、視覚コンテキストが増えるほど、同じバックボーンを持つQwen3-VL-8Bに対するtime-to-first-tokenの優位性が2.8倍から5.1倍へ広がったと報告されています。これは、リアルタイム性能がモデル規模だけでなく、視覚情報を生成処理へ接続する方法にも左右されることを示します。

意義と残る検証

MOSS-VLの意義は、リアルタイムマルチモーダル対話を分解して設計した点にあります。アーキテクチャが継続的な視覚参照を支え、データが発話と修正のタイミングを教え、カリキュラムが専門訓練の負担を抑えます。動画アシスタントや proactive alerting など、継続観測を必要とする用途のオープンな実装例になり得ます。

一方、今回の素材には各ベンチマークの詳細条件、ハードウェア環境、誤りの内訳までは含まれていません。長時間稼働時の安定性、スループット、不要な割り込みを避ける信頼性については、今後の再現実験が必要です。5つのチェックポイント、訓練手順、リアルタイム推論コードの公開は、その比較検証を進めるための基盤となります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Multimodal Flow、言語と視覚を一つの連続生成プロセスで統合
マルチモーダル
cctest.ai
マルチモーダル

Multimodal Flow、言語と視覚を一つの連続生成プロセスで統合

HUST Vision Lab は、言語と画像を同じ連続空間で扱う Multimodal Flow を提案した。画像を離散トークンへ量子化せず、連続ハイパーチャンクと共有 Flow Matching バックボーンで両モダリティを統一的にモデル化する。

続きを読む
CCTest · Blog
画像生成を視覚推論の中間ステップにするReImaGin
マルチモーダル
cctest.ai
マルチモーダル

画像生成を視覚推論の中間ステップにするReImaGin

ReImaGinは、画像生成モデルをマルチモーダル大規模言語モデルの視覚推論機構として利用する手法です。6種類のタスクで、テキストのみの推論や専用視覚ツールのベースラインを上回り、最大25%の改善が報告されています。

続きを読む
CCTest · Blog
OmniTaskonomyが示す、視覚生成から視覚理解への能力転移
マルチモーダル
cctest.ai
マルチモーダル

OmniTaskonomyが示す、視覚生成から視覚理解への能力転移

画像生成の学習は、条件が合えば視覚理解も高められるのでしょうか。OmniTaskonomyは、19種類の画像間生成タスクと25種類の理解能力を整理し、どのタスク間で転移が起きるのかを分析しました。

続きを読む