LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ
LiveAnimate は、人物アニメーション生成の実用化を妨げてきた二つの問題、つまり生成速度の遅さと長尺時のメモリ増大に取り組んだ研究です。拡散モデルは画質面で強い一方、1クリップの生成に時間がかかり、対話的な用途には向きにくいという弱点があります。とくにライブ配信、仮想アバター、遠隔コミュニケーションでは、出力が止まらず、かつ見た目の一貫性が保たれることが重要です。
著者らは、14B パラメータの動画 Diffusion Transformer をベースに、ストリーミング推論に適した形へ再構成しました。
主要なポイント
- 2段階学習: まず Reference-Anchored Teacher-Forcing Adaptation により、双方向 DiT をブロック因果の自己回帰生成器へ適応。
- 3ステップまでの蒸留: Block-wise Self-Forcing Distillation により、サンプリング予算を大幅に削減。
- PR-Sink Attention: KV キャッシュを無制限に保持せず、Static Sink、Dynamic Sink、3スロットの Rolling Window を組み合わせた有界メモリ機構を採用。
- 姿勢類似度による履歴再利用: 似た姿勢が再登場したとき、関連する外観コンテキストを取り戻し、長時間でも見た目の崩れを抑える。
- 実行最適化: Ulysses sequence parallelism と演算子融合により、2枚の NVIDIA H100 で 19.63 FPS を実現。
何が重要か
この論文の価値は、単に「大きなモデルを速くした」ことではありません。リアルタイムの動画生成では、短いクリップの品質よりも、長く動かし続けたときの安定性が本質的です。顔や服装、人物同一性が徐々に崩れると、実用上はすぐに破綻します。
PR-Sink の発想は、長尺生成における記憶管理の方向性を示しています。すべてを覚えるのではなく、初期の基準点と重要な履歴だけを残し、必要なときに姿勢に応じて引き戻す。この考え方は、将来のストリーミング映像生成やデジタルヒューマンの設計にも応用しやすいでしょう。
つまり LiveAnimate は、動画生成を「高品質なオフライン処理」から「継続的に動くオンラインシステム」へ近づける試みだと言えます。
コメント
ログイン状態を確認中…
コメントを読み込み中…