Self Gradient Forcing:長尺動画生成の「記憶の書き込み」を訓練する
導入
長尺動画生成の難しさは、次のフレームを自然に作ることだけではありません。人物や物体の同一性、背景やレイアウト、動きのリズムを長い時間にわたって保つ必要があります。近年の自回帰型動画拡散モデルでは、Self Forcing が使われることが増えています。これは、訓練時に正解動画の履歴だけでなく、モデル自身が rollout で生成した履歴を使う方法で、推論時とのずれを小さくし、露出バイアスを減らす狙いがあります。
しかし本論文は、Self Forcing だけでは十分でないと指摘します。過去に生成された潜在表現は履歴 key-value キャッシュに保存され、未来フレームがそれを参照します。ところが、未来フレームの損失は、過去の潜在表現をどのように有用なキーやバリューとして書き込むべきかを十分に監督できません。著者らはこれを historical context-gradient gap と呼んでいます。
核心ポイント
- メモリは読まれるが、書き込みは十分に学習されない。 自回帰型動画拡散では、KV キャッシュが因果的な記憶として働きます。しかし、それが凍結された rollout 状態として扱われると、未来の失敗が過去のコンテキスト表現の作り方に戻りにくくなります。
- Self Gradient Forcing(SGF)は二段階の訓練を行う。 第1段階では、推論と同じ形で無勾配の自回帰 rollout を実行します。そして、サンプリングされた denoising の退出ステップで、自己生成コンテキストとモデルに入力されたノイズ付き潜在表現を記録します。
- 第2段階でコンテキスト勾配を再構成する。 生成済みコンテキストは stop-gradient のクリーンな潜在入力として使い、モデルはコンテキストの KV 表現と未来からコンテキストへの因果注意を再計算します。これにより、未来動画潜在表現の損失が、より有効な因果メモリの作り方を学習させます。
- 長い rollout 全体の逆伝播を避ける。 SGF は、完全な直列 rollout 全体に逆伝播するのではなく、記録した退出ステップで欠けていた監督信号を回復する設計です。
意義と影響
論文の概要によれば、SGF はさまざまな初期化条件のもと、長期のフレーム単位およびチャンク単位の実験で Self Forcing を上回りました。特に、主体の同一性、背景やレイアウトの一貫性、時間的安定性で効果が見られるとされています。また、5秒の訓練ウィンドウだけを用いて、数分に及ぶ動画へ外挿できる点も強調されています。
この研究の重要性は、長尺動画生成を「より長くデノイズする問題」ではなく、「過去の生成結果を将来に役立つ記憶としてどう書き込むか」という問題として捉え直した点にあります。自回帰型動画モデルが長い出力へ進むほど、履歴メモリの品質は中心的な課題になります。SGF は、その訓練信号を現実的な形で補うアプローチとして注目できます。
コメント
ログイン状態を確認中…
コメントを読み込み中…