OneStreamer:動画を見ながら記憶し、適切なタイミングで応答する4Bモデル
背景
ストリーミング動画との対話では、通常の動画質問応答とは異なる課題が生じます。将来どの場面が質問に関係するか分からない段階で、モデルは観測した情報を記録しておく必要があります。一方で、過去の映像特徴をすべて保持すると、計算量と遅延が増大します。さらに、証拠が十分になった時点で応答し、単に新しいフレームを待ち続けないことも求められます。
OneStreamerは、知覚、記憶、応答タイミングを別々の処理として扱わず、動画の到着に合わせた能動生成でまとめて学習します。モデルは観測内容を記録し、関連する証拠がそろった時点でタスクへの応答を生成します。
主な仕組み
- PHCMによる階層的なキャプション記憶:Proactive Hierarchical Caption Memoryは、局所的な細部を時間情報付きで記述し、イベントが完了すると要約を作成します。元のフレームが直近の視覚ウィンドウから外れても、記録された事実を後から利用できます。
- 視覚ウィンドウと生成記憶の併用:推論時には、最近の映像と過去に生成したキャプションを組み合わせます。これにより、すべての過去の視覚特徴を何度も読み直す必要を減らします。
- PSTLによる応答タイミングの学習:ストリームには同じ待機状態が多く含まれます。Proactive State Transition Learningは出力アンカーにおける監督を保ちつつ、状態変化と状態維持を代表するトークンを選び、待機状態への偏りを抑えます。
- ストリーミング用データ合成:各時点で利用できる証拠に合わせて、キャプションや回答の内容とタイミングを調整するデータ生成パイプラインを構築しています。生成データと整理済みのオープンデータを組み合わせ、OneStreamer-1Mを作成しました。
結果と意義
提供された素材によれば、4Bモデルは知覚、記憶、能動応答を含む8つのストリーミング動画理解ベンチマークすべてで、比較対象の中で最良の総合結果を示しました。アブレーションでは、生成キャプションを保持すると履歴に関する質問応答が改善し、リアルタイム知覚は低下しませんでした。また、PSTLは注釈された状態トークンの27.5%だけを監督に使いながら、密な状態監督を上回りました。
この研究の意義は、ストリーミング動画の記憶を、増え続ける視覚特徴の保存ではなく、時間に結び付いた再利用可能な記録として捉えた点にあります。長時間動画の分析やカメラアシスタントなど、低遅延と過去情報の参照を両立したい用途に適した考え方です。ただし、キャプションが誤っていれば、その誤りが後続の回答に引き継がれる可能性があります。今後は回答精度だけでなく、記憶の事実性、時間的な対応関係、誤りの伝播も検証する必要があります。
コメント
ログイン状態を確認中…
コメントを読み込み中…