記事一覧へ戻る
視覚・動画

OneStreamer:動画を見ながら記憶し、適切なタイミングで応答する4Bモデル

読了目安 3 分

背景

ストリーミング動画との対話では、通常の動画質問応答とは異なる課題が生じます。将来どの場面が質問に関係するか分からない段階で、モデルは観測した情報を記録しておく必要があります。一方で、過去の映像特徴をすべて保持すると、計算量と遅延が増大します。さらに、証拠が十分になった時点で応答し、単に新しいフレームを待ち続けないことも求められます。

OneStreamerは、知覚、記憶、応答タイミングを別々の処理として扱わず、動画の到着に合わせた能動生成でまとめて学習します。モデルは観測内容を記録し、関連する証拠がそろった時点でタスクへの応答を生成します。

主な仕組み

  • PHCMによる階層的なキャプション記憶:Proactive Hierarchical Caption Memoryは、局所的な細部を時間情報付きで記述し、イベントが完了すると要約を作成します。元のフレームが直近の視覚ウィンドウから外れても、記録された事実を後から利用できます。
  • 視覚ウィンドウと生成記憶の併用:推論時には、最近の映像と過去に生成したキャプションを組み合わせます。これにより、すべての過去の視覚特徴を何度も読み直す必要を減らします。
  • PSTLによる応答タイミングの学習:ストリームには同じ待機状態が多く含まれます。Proactive State Transition Learningは出力アンカーにおける監督を保ちつつ、状態変化と状態維持を代表するトークンを選び、待機状態への偏りを抑えます。
  • ストリーミング用データ合成:各時点で利用できる証拠に合わせて、キャプションや回答の内容とタイミングを調整するデータ生成パイプラインを構築しています。生成データと整理済みのオープンデータを組み合わせ、OneStreamer-1Mを作成しました。

結果と意義

提供された素材によれば、4Bモデルは知覚、記憶、能動応答を含む8つのストリーミング動画理解ベンチマークすべてで、比較対象の中で最良の総合結果を示しました。アブレーションでは、生成キャプションを保持すると履歴に関する質問応答が改善し、リアルタイム知覚は低下しませんでした。また、PSTLは注釈された状態トークンの27.5%だけを監督に使いながら、密な状態監督を上回りました。

この研究の意義は、ストリーミング動画の記憶を、増え続ける視覚特徴の保存ではなく、時間に結び付いた再利用可能な記録として捉えた点にあります。長時間動画の分析やカメラアシスタントなど、低遅延と過去情報の参照を両立したい用途に適した考え方です。ただし、キャプションが誤っていれば、その誤りが後続の回答に引き継がれる可能性があります。今後は回答精度だけでなく、記憶の事実性、時間的な対応関係、誤りの伝播も検証する必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
連続動画ストリームで自己教師あり学習が難しくなる理由
視覚・動画
cctest.ai
視覚・動画

連続動画ストリームで自己教師あり学習が難しくなる理由

フレームを時間順に処理し、全体シャッフルや複数エポックの再利用を行わない環境では、従来の視覚自己教師あり学習が大きく性能を落とす。研究チームは、入力パイプラインを調整したStreamMAEでこの問題に取り組んだ。

続きを読む
CCTest · Blog
FlashForward、飛行中のKVキャッシュで長時間動画拡散を高速化
視覚・動画
cctest.ai
視覚・動画

FlashForward、飛行中のKVキャッシュで長時間動画拡散を高速化

FlashForwardは、ノイズ除去中にすでに計算されているKVキャッシュを再利用し、履歴を構築するための追加推論を削減する。ノイズを含む履歴による品質低下には、疎なクリーンアンカーを組み合わせて対応する。

続きを読む