記事一覧へ戻る
推論・デプロイ

LiveAnimate:長尺の人物アニメーションをリアルタイム配信へ

読了目安 2 分

LiveAnimate は、人物アニメーション生成の実用化を妨げてきた二つの問題、つまり生成速度の遅さと長尺時のメモリ増大に取り組んだ研究です。拡散モデルは画質面で強い一方、1クリップの生成に時間がかかり、対話的な用途には向きにくいという弱点があります。とくにライブ配信、仮想アバター、遠隔コミュニケーションでは、出力が止まらず、かつ見た目の一貫性が保たれることが重要です。

著者らは、14B パラメータの動画 Diffusion Transformer をベースに、ストリーミング推論に適した形へ再構成しました。

主要なポイント

  • 2段階学習: まず Reference-Anchored Teacher-Forcing Adaptation により、双方向 DiT をブロック因果の自己回帰生成器へ適応。
  • 3ステップまでの蒸留: Block-wise Self-Forcing Distillation により、サンプリング予算を大幅に削減。
  • PR-Sink Attention: KV キャッシュを無制限に保持せず、Static Sink、Dynamic Sink、3スロットの Rolling Window を組み合わせた有界メモリ機構を採用。
  • 姿勢類似度による履歴再利用: 似た姿勢が再登場したとき、関連する外観コンテキストを取り戻し、長時間でも見た目の崩れを抑える。
  • 実行最適化: Ulysses sequence parallelism と演算子融合により、2枚の NVIDIA H100 で 19.63 FPS を実現。

何が重要か

この論文の価値は、単に「大きなモデルを速くした」ことではありません。リアルタイムの動画生成では、短いクリップの品質よりも、長く動かし続けたときの安定性が本質的です。顔や服装、人物同一性が徐々に崩れると、実用上はすぐに破綻します。

PR-Sink の発想は、長尺生成における記憶管理の方向性を示しています。すべてを覚えるのではなく、初期の基準点と重要な履歴だけを残し、必要なときに姿勢に応じて引き戻す。この考え方は、将来のストリーミング映像生成やデジタルヒューマンの設計にも応用しやすいでしょう。

つまり LiveAnimate は、動画生成を「高品質なオフライン処理」から「継続的に動くオンラインシステム」へ近づける試みだと言えます。

出典: Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
考え続けるだけでは足りない:小型推論モデルに「助けを求める」判断を教えるFlyBy
推論・デプロイ
cctest.ai
推論・デプロイ

考え続けるだけでは足りない:小型推論モデルに「助けを求める」判断を教えるFlyBy

KAIST AIの研究は、自己反省を長く続けても、小型推論モデルが到達できる解の範囲は必ずしも広がらないことを示した。FlyByは、知識不足を検出した場合だけ強力なモデルに問い合わせる。

続きを読む
CCTest · Blog
LLMのPrefillとDecodeを分離量子化するDQ、速度と精度を両立
推論・デプロイ
cctest.ai
推論・デプロイ

LLMのPrefillとDecodeを分離量子化するDQ、速度と精度を両立

Disaggregated Quantization(DQ)は、LLM推論のPrefillとDecodeに異なる量子化方式、重み、保存場所を割り当てる手法です。低ビット推論の効率を維持しながら、長いプロンプトの処理速度と生成精度の改善を狙います。

続きを読む
CCTest · Blog
HybridInfer、スマホの熱余裕を使ってLLMの実行先を選択
推論・デプロイ
cctest.ai
推論・デプロイ

HybridInfer、スマホの熱余裕を使ってLLMの実行先を選択

HybridInferは、実際のAndroid端末で端末内・エッジ・クラウドのLLMを動的に振り分ける強化学習ルーターです。モバイル推論の問題は単なる速度低下ではなく、連続生成による実行環境の不安定化にも及ぶと指摘します。

続きを読む