記事一覧へ戻る
メモリ・コンテキスト

長時間動画の記憶を「物体中心」に:GEBが視覚エンティティの履歴を構築

読了目安 3 分

導入

長時間動画の質問に答える際、難しいのは場面を見つけることだけではありません。異なる時点に映った物体が、同じ物理的な実体なのかを判断する必要があります。例えば、朝にキッチンにあった青いカップが、夜にはリビングで使われているかもしれません。時系列の説明だけに依存すると、似たカップを混同したり、同じカップの観察を別々の出来事として扱ったりする可能性があります。

Amazon Scienceが提案する Grounded Entity Biographies(GEB) は、この問題に対して、出来事だけでなくエンティティを中心に長時間動画の記憶を構成します。視覚的に接地された同一の物理的実体について、時間をまたぐ「履歴」を作るのが基本的な考え方です。

主なポイント

  • 出来事中心からエンティティ中心へ:GEBは各クリップの観察を孤立した記録として保存するのではなく、同じ物理的インスタンスの観察をまとめます。
  • 場面の文脈を維持:観察を結び付けた後も、いつ、どこで、どのような出来事の中で現れたかという情報を保持します。
  • 履歴とエピソード証拠を同時検索:質問応答時には、エンティティの履歴を関連する場面の証拠と一緒に取得します。これにより、モデルは対象の同一性と個々の場面を組み合わせて推論できます。
  • 視覚的な同一性リンクが重要:アブレーションでは、説明文を増やすだけでは改善を完全には再現できませんでした。視覚的な同一性の関連付けと、質問時に履歴を読む仕組みの双方が性能に寄与しています。

評価結果

研究では、1日から1週間に及ぶ記録を含む4つのベンチマークで、選択式と自由記述の質問応答を評価しました。GEBは従来の長時間動画メモリーフレームワークを上回り、EgoLifeQAでは72.0%の精度を達成しました。これは、素材で示された従来の最高公開結果を4.4ポイント上回る値です。

公開されている概要だけでは実装の全詳細は分かりません。そのためGEBは、単純に入力コンテキストを長くする手法というより、視覚的な同一性、出来事の文脈、検索を一体化する記憶設計として捉えるのが適切です。

意義と課題

GEBが示すのは、時間の連続性と対象の同一性は別の問題だという点です。生活記録、監視映像、長期的なロボット知覚では、「何が起きたか」だけでなく、「質問が指す具体的な物体がその後どう現れたか」を追跡できることが重要になります。

一方で、遮蔽、視点の変化、外観の類似は同一性の推定を難しくします。GEBの意義は、説明を増やせば十分とは限らず、長期的な動画記憶には信頼できる視覚的な同一性リンクも必要だと、評価を通じて示した点にあります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
分割KVキャッシュ圧縮が生む周期的な検索の弱点
メモリ・コンテキスト
cctest.ai

分割KVキャッシュ圧縮が生む周期的な検索の弱点

分割型KVキャッシュ圧縮を使うモデルでは、同じ情報でも圧縮ウィンドウ内の位置によって検索しやすさが変わることが分かりました。平均スコアだけでは、周期的に現れる弱点を見落とす可能性があります。

続きを読む
CCTest · Blog
Context Language Models:モデル自身が文脈を管理する新しい設計
メモリ・コンテキスト
cctest.ai

Context Language Models:モデル自身が文脈を管理する新しい設計

Meta の研究チームは、文脈をモデルが自由に書き換えられるファイルとして扱う Context Language Models(CLM)を提案した。複数の長時間エージェント課題で、性能向上と計算量削減の両立を報告している。

続きを読む
CCTest · Blog
PISA、ブロック疎注意を O(N log N) の対数線形複雑度へ
メモリ・コンテキスト
cctest.ai

PISA、ブロック疎注意を O(N log N) の対数線形複雑度へ

ByteDance Seed の研究チームが、粗い候補から細かい候補へ段階的に絞り込む PISA を提案しました。ピラミッド型 Top-K 選択により、長文脈モデルにおけるブロック選択の二次コストを抑えます。

続きを読む