返回文章列表
视觉与视频

4DAnyone:从一段普通单目视频重建可动的4D人物

阅读约 3 分钟

导语

用手机或普通相机拍摄一段人物视频,再得到能够自由旋转观察的动态三维人物,是4D视觉中的一个重要目标。难点在于:单目视频只记录了一个观察方向,而4D重建不仅需要补全不可见区域,还要让不同视角在外观、结构和运动时间上保持一致。4DAnyone提出了一条“先生成多视角视频,再进行4D重建”的路线,目标是从未经标定的单目视频中恢复可用于4D高斯泼溅(4DGS)的人物表示。

核心方法

传统的相机控制视频扩散模型能够生成看起来合理的新视角,但当4DGS需要几十个目标视角时,问题会明显放大。模型通常无法在一次DiT前向计算中同时处理所有视角,只能将目标视角拆分成多个组。这会带来两个相互关联的瓶颈:

  • 参考上下文不断膨胀。 随着新视角持续生成,模型需要参考越来越多的已生成画面。上下文规模按视角数量增长后,外观指导会变弱,模型更容易丢失身份、服装和纹理等信息。
  • 目标组之间缺乏交流。 被拆开的视角组无法直接共享信息,生成结果可能出现身体比例、局部形状或整体结构逐步漂移。

4DAnyone针对这两点设计了两个组件。Reference Context Packing(RCP)将不断增加的参考视角压缩到固定长度的混合分辨率上下文中,使参考侧的上下文复杂度保持为O(1),同时保留不同尺度的外观线索。Target Context Routing(TCR)则在去噪过程中轮换目标视角的分组方式,让不同组在高噪声阶段交换更广泛的结构信息,并在低噪声阶段收敛细节,从而降低跨组不一致。

完成多视角视频生成后,系统再将这些结果提升到4DGS表示。换言之,视频扩散模型在这里不只是负责“换个角度生成画面”,而是被用作单目输入与动态三维重建之间的桥梁。

数据与实验

为支持训练,作者构建了基于自研游戏引擎的MVGameHuman数据集,并结合光场采集和真实场景视频数据。论文在DNA-Rendering与DyMVHumans上比较了相关方法,报告称4DAnyone在新视角视频质量和后续4DGS重建效果上均优于此前方法,并具备面向真实环境视频的泛化能力。素材没有提供具体指标,因此这里不对提升幅度作量化判断。

意义与局限

这项工作的价值不只在于生成更“像真的”新视角,而在于把多视角一致性放到了4D重建流程的核心位置。RCP解决的是参考信息越积越多后的效率与有效性问题,TCR解决的是分组生成造成的全局协调问题,二者共同针对扩散模型上下文容量与重建需求之间的矛盾。

如果这一路线继续成熟,人物数字化、虚拟试穿、影视预演、游戏角色制作和远程交互都可能受益。与此同时,单目输入天然存在遮挡、深度歧义和快速运动等问题,生成式补全也可能引入与真实人物不一致的内容。因此,4DAnyone更适合被理解为降低4D人物重建门槛的一种生成式方案,而不是消除单目视觉不确定性的最终答案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章