記事一覧へ戻る
視覚・動画

動画拡散モデルが物理法則を破る理由――注意機構の盲点

読了目安 3 分

導入

動画拡散モデルは、細部まで精細で見栄えのよい映像を生成できるようになった。しかし、視覚的な品質と物理的な一貫性は同じではない。物体が突然方向を変えたり、フレーム間で不自然に移動したり、遮蔽や変形の際に位置関係が崩れたりする問題は依然として残っている。BUPT-CIST の研究チームは、この問題を外部の物理シミュレーターや専用データだけで解決するのではなく、モデル内部の生成過程から調べた。

動きは早期に決まる

論文では、初期のノイズ除去段階を、モデルが暗黙に動きを計画する過程として捉えている。分析からは、まず物体の大まかな形状や位置を決め、その後にテクスチャーや細部を補う「形状が先、詳細が後」という傾向が示される。初期の空間的な選択が強くなると、後の段階で軌道を修正する余地は小さくなる。

研究者は、クロスアテンションの軌跡と、各アテンションヘッドの因果的な寄与を組み合わせた。これにより、動きの計画に特に関係する一部のヘッドを特定した。すべてのヘッドが同じように運動を決めているわけではない、という点が重要である。

RoPE が生む早すぎる固定

自己注意の分析では、回転位置埋め込み(RoPE)がより具体的な要因として浮かび上がる。RoPE は位置関係を表現するための仕組みだが、初期のノイズ除去段階では空間的な注意の減衰が強くなりすぎる場合があるという。結果として、離れた候補領域が十分に検討されにくくなる。

モデルが物理的に不適切な位置を早い段階で選ぶと、隣接フレームにおける妥当な候補が抑え込まれる。その結果、急なジャンプ、漂移、不連続な運動が生じる可能性がある。つまり問題は、物理知識の不足だけでなく、注意機構が探索範囲を早く狭めすぎることにもある。

軽量な修正と意義

提案手法は、ノイズ除去ステップに応じて RoPE の周波数をスケーリングする。初期段階では空間的な注意の過度な減衰を抑え、動きの候補をより広く探索できるようにする。その後、生成が進むにつれて細部の精密化に適した位置制約へ移行する。大規模な追加学習を必須としない軽量な変更であり、学習なし・学習ありの設定の双方に適用できる。

提供された概要では、両方の実験設定で生成動画の物理的な一貫性が改善したと報告されている。一方、詳細な指標、対象モデルの範囲、物理シーン別の比較は示されていない。したがって、異なるアーキテクチャーや複雑な運動にも安定して適用できるかは、今後の検証課題である。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Vidu S2、リアルタイムのアバターと動画編集、空間映像を統合
視覚・動画
cctest.ai
視覚・動画

Vidu S2、リアルタイムのアバターと動画編集、空間映像を統合

Vidu S2は、対話型デジタルアバターと動画ストリーム編集をリアルタイムで実行する2つのモデルで構成されます。生成中に指示や参照画像を更新し、映像を継続的に操作するワークフローを目指しています。

続きを読む
CCTest · Blog
ShallowStream:浅い層で索引を作り、深い層で動画を理解する
視覚・動画
cctest.ai
視覚・動画

ShallowStream:浅い層で索引を作り、深い層で動画を理解する

ShallowStreamは、MLLMの浅い層を使ってストリーミング動画の符号化と検索用インデックスの構築を行い、質問時だけ深い層を活用します。論文では、フレーム単位のプリフィル遅延を最大52.1倍、10秒間のエンドツーエンド遅延を最大11.9倍削減したと報告しています。

続きを読む