記事一覧へ戻る
推論・デプロイ

LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ

読了目安 2 分

LiveAnimate は、人物アニメーション生成の実用化を妨げてきた二つの問題、つまり生成速度の遅さ長尺時のメモリ増大に取り組んだ研究です。拡散モデルは画質面で強い一方、1クリップの生成に時間がかかり、対話的な用途には向きにくいという弱点があります。とくにライブ配信、仮想アバター、遠隔コミュニケーションでは、出力が止まらず、かつ見た目の一貫性が保たれることが重要です。

著者らは、14B パラメータの動画 Diffusion Transformer をベースに、ストリーミング推論に適した形へ再構成しました。

主要なポイント

  • 2段階学習: まず Reference-Anchored Teacher-Forcing Adaptation により、双方向 DiT をブロック因果の自己回帰生成器へ適応。
  • 3ステップまでの蒸留: Block-wise Self-Forcing Distillation により、サンプリング予算を大幅に削減。
  • PR-Sink Attention: KV キャッシュを無制限に保持せず、Static Sink、Dynamic Sink、3スロットの Rolling Window を組み合わせた有界メモリ機構を採用。
  • 姿勢類似度による履歴再利用: 似た姿勢が再登場したとき、関連する外観コンテキストを取り戻し、長時間でも見た目の崩れを抑える。
  • 実行最適化: Ulysses sequence parallelism と演算子融合により、2枚の NVIDIA H100 で 19.63 FPS を実現。

何が重要か

この論文の価値は、単に「大きなモデルを速くした」ことではありません。リアルタイムの動画生成では、短いクリップの品質よりも、長く動かし続けたときの安定性が本質的です。顔や服装、人物同一性が徐々に崩れると、実用上はすぐに破綻します。

PR-Sink の発想は、長尺生成における記憶管理の方向性を示しています。すべてを覚えるのではなく、初期の基準点と重要な履歴だけを残し、必要なときに姿勢に応じて引き戻す。この考え方は、将来のストリーミング映像生成やデジタルヒューマンの設計にも応用しやすいでしょう。

つまり LiveAnimate は、動画生成を「高品質なオフライン処理」から「継続的に動くオンラインシステム」へ近づける試みだと言えます。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
UniMoMo:推薦 MoE を専門家マージで軽量化する手法
推論・デプロイ
cctest.ai
推論・デプロイ

UniMoMo:推薦 MoE を専門家マージで軽量化する手法

UniMoMo は、学習済みの推薦向け MoE モデルを、より少ない専門家数の標準 MoE へ変換する後処理圧縮フレームワークです。重みの近さではなく、校正データ上での振る舞いとルーティング量を見て専門家を統合します。

続きを読む
CCTest · Blog
vLLM の DCP、長文脈推論における KV キャッシュの壁を崩す
推論・デプロイ
cctest.ai
推論・デプロイ

vLLM の DCP、長文脈推論における KV キャッシュの壁を崩す

vLLM の Decode Context Parallelism(DCP)は、KV キャッシュを注意ヘッドではなくシーケンス方向に分割する。長文脈エージェント負荷で顕在化する GPU メモリ不足を緩和し、高並行時のスループット改善を狙う仕組みだ。

続きを読む
CCTest · Blog
GPTQ-2D:双方向の適応的丸めを4次時間から3次時間へ
推論・デプロイ
cctest.ai
推論・デプロイ

GPTQ-2D:双方向の適応的丸めを4次時間から3次時間へ

GPTQ-2D は、残差の左側と右側の両方に基底行列が作用する、より一般的な適応的丸め問題を扱う。行列を単純にベクトル化する方法と同じ丸め結果を保ちながら、反対角線ごとの処理で計算量を3次時間に下げる。

続きを読む