記事一覧へ戻る
マルチモーダル

MOSS-VL、話しながら見続けるリアルタイムVLMを設計

読了目安 3 分

導入

一般的な視覚言語モデルは、画像や動画を入力し終えてから回答を生成するオフライン型です。しかしリアルタイムのアシスタントでは、モデルが話している途中にも新しい映像が届きます。すべてのフレームを待てば応答が遅れ、早く話し始めれば後から得た情報との整合性が課題になります。MOSS-VL Technical Reportは、この「見ながら話す」能力を付加機能ではなく、中心的な設計目標として扱っています。

主な設計

  • ゲート付きクロスアテンションを採用。 言語デコーダーは、生成中のトークン列に視覚トークンを直接追加するのではなく、ゲート付きクロスアテンションを通じて視覚表現を参照します。これにより、生成中も新しいフレームを受け取りやすく、視覚コンテキストがデコード列を直接圧迫することも避けられます。
  • 発話のタイミングを学習。 合成された対話コーパスを使い、いつ自発的に話すべきか、いつ沈黙すべきか、新しい情報を得たときに過去の回答をどう修正するかを指導します。通常の画像質問応答データだけでは、こうした行動は十分に学べません。
  • リアルタイム訓練を最終段階に集約。 まず強力なオフライン基盤で一般的な視覚言語能力を構築し、最後の軽量な段階でリアルタイム固有の訓練を行います。これにより、ストリーミング能力の追加コストを抑えつつ、オフライン性能への影響を抑える狙いです。

評価結果

報告によれば、MOSS-VL-Instructは同程度の規模のオフライン課題で競争力を持ち、時間的推論を測る動画データセットで高い結果を示しました。MOSS-VL-Realtimeは4つのストリーミングベンチマークのうち3つで、オープンソースのストリーミングモデル中、平均スコアが最良でした。残る1つでは2位です。特に自発的な行動を測る3つのサブセットをすべて制し、OmniMMI Proactive Alertingでは66.0点で、報告中の最良ベースライン37.5点を上回りました。

モデルは113億パラメータです。視覚トークンをデコード列の外側で扱うため、視覚コンテキストが増えるほど、同じバックボーンを持つQwen3-VL-8Bに対するtime-to-first-tokenの優位性が2.8倍から5.1倍へ広がったと報告されています。これは、リアルタイム性能がモデル規模だけでなく、視覚情報を生成処理へ接続する方法にも左右されることを示します。

意義と残る検証

MOSS-VLの意義は、リアルタイムマルチモーダル対話を分解して設計した点にあります。アーキテクチャが継続的な視覚参照を支え、データが発話と修正のタイミングを教え、カリキュラムが専門訓練の負担を抑えます。動画アシスタントや proactive alerting など、継続観測を必要とする用途のオープンな実装例になり得ます。

一方、今回の素材には各ベンチマークの詳細条件、ハードウェア環境、誤りの内訳までは含まれていません。長時間稼働時の安定性、スループット、不要な割り込みを避ける信頼性については、今後の再現実験が必要です。5つのチェックポイント、訓練手順、リアルタイム推論コードの公開は、その比較検証を進めるための基盤となります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SPARGen:3D再構成・密な対応付け・空間推論を統合するマルチモーダル生成モデル
マルチモーダル
cctest.ai
マルチモーダル

SPARGen:3D再構成・密な対応付け・空間推論を統合するマルチモーダル生成モデル

SPARGen は、空間理解に関わる複数のタスクを、指示条件付きの生成問題として統一する枠組みだ。個別モジュールではなく、同一のネイティブなマルチモーダル生成モデルで空間表現を学習する点に特徴がある。

続きを読む
CCTest · Blog
UniSwap:顔と声の置き換えを一つのストリーミングモデルへ
マルチモーダル
cctest.ai
マルチモーダル

UniSwap:顔と声の置き換えを一つのストリーミングモデルへ

UniSwap は、話者動画における外見と声質の同時置き換えを目指す音声・映像統合フレームワークです。別々のモデルを後段でつなぐのではなく、単一の音声映像拡散 Transformer 内で両方を扱います。

続きを読む