LiveAnimate:把 14B 视频扩散模型推向实时长流式人像动画
LiveAnimate 这篇工作瞄准的是一个很实际的问题:人像动画模型在实验室里能生成高质量视频,但一旦进入直播、虚拟人或远程呈现场景,速度和稳定性就会立刻成为瓶颈。扩散模型通常擅长细节和一致性,却很难做到低延迟、长时间连续输出。LiveAnimate 的思路不是绕开扩散式生成,而是直接把一套 14B 参数的视频 Diffusion Transformer 改造成可流式工作的实时系统。
核心做法
- 两阶段训练:先用 Reference-Anchored Teacher-Forcing Adaptation,把原本的双向 DiT 适配成块级因果的自回归生成器;再用 Block-wise Self-Forcing Distillation,把采样预算压到 3 步。
- PR-Sink 注意力:这是一个有界 KV cache 方案,不再把整段历史都留在缓存里,而是结合三部分记忆:永久锚定首块的 Static Sink、基于姿态检索到的 Dynamic Sink,以及一个三槽滚动窗口。
- 按姿态检索历史外观:当相似姿态再次出现时,系统可以把相关外观上下文找回来,减少长序列中“越生成越走样”的问题。
- 面向部署优化:结合 Ulysses sequence parallelism 和算子融合,实现了双 NVIDIA H100 上 19.63 FPS 的流式推理。
这项工作的重要性
这篇论文最值得关注的地方,不只是“把模型跑快了”,而是它把实时性、长程稳定性和显存约束放进了同一个系统设计里。对于直播数字人、实时 telepresence、虚拟主播这类场景,用户最在意的往往不是单帧质量,而是模型能否持续输出、能否在动作反复变化时保持同一个人、同一套服装和细节。
PR-Sink 的意义在于,它用固定大小的缓存维持长序列推理,把“记住整个过去”改成“在需要时找回关键过去”。这类设计对未来的流式视频生成很有参考价值,因为真正可用的生成系统,往往不是单次生成最漂亮,而是长时间在线时仍然稳定、可控、成本可预测。
需要注意的是,这类结果主要说明系统工程和训练策略的结合已经足够强,但真实应用中仍要看不同姿态复杂度、人物遮挡、身份一致性等更细的条件表现。
评论
正在确认登录状态……
正在加载评论……