返回文章列表
视觉与视频

跨越形态差异的视频运动迁移:MBM 尝试摆脱“骨架对应”依赖

阅读约 3 分钟

导语

视频运动迁移的目标,是让一个目标对象按照参考视频中的动态方式“动起来”。在常见设定中,系统往往假设参考对象和目标对象之间存在某种结构对应,例如相似的肢体、关节或局部部件。但当对象跨越很大类别差异时,这种假设会变得脆弱:人的跑动、动物的摆动、柔性物体的形变,未必能通过固定骨架或部件一一映射。

Hugging Face Daily Papers 收录的论文 Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations,正是围绕这一痛点展开。作者将问题表述为“超越形态的运动迁移”:在不依赖固定结构对应的前提下,尽量保留那些跨对象形态仍然有意义的动态信息。

核心要点

  • 从结构对应转向抽象运动表示:论文认为,跨类别运动迁移不应只追求部件级匹配,而应提取更高层、更通用的运动线索,例如整体节奏、方向、幅度和时序变化。
  • 两阶段框架设计:第一阶段学习互补的多粒度抽象运动视图,并利用这些表示来构造跨类别视频配对监督;第二阶段把这种监督内化到生成模型中,使推理时可以直接使用参考视频作为条件,而不必显式执行运动提取流程。
  • 覆盖不同类别跨度:作者提出 OpenVMT-Dataset 和 OpenVMT-Bench,用于训练和评估图像条件、文本条件下的视频运动迁移,并将任务划分为 Same、Near、Far 三种类别差距。
  • 强调两类目标:实验结果声称该方法在运动保真度和目标保持方面达到领先表现,即既要像参考视频那样运动,又要尽量保持目标对象自身身份、外观和语义。

意义与影响

这项工作的价值在于,它把视频生成中的“运动控制”从相对封闭的同构对象场景,推向更开放的跨类别场景。如果模型只能在人到人、车到车这类相似结构之间迁移动作,应用范围会受到明显限制;而一旦能在形态差异显著的对象之间传递可解释的动态,就可能服务于动画制作、创意视频生成、虚拟角色驱动和更灵活的视觉内容编辑。

当然,摘要中也透露出一个关键挑战:所谓“可迁移的运动”本身并没有唯一答案。不同目标对象会以不同物理方式实现相似动态,因此模型需要在保留参考动态与尊重目标形态之间做平衡。MBM 通过抽象运动表示和跨类别监督来处理这一问题,提供了一个值得关注的研究方向。

作者计划在论文接收后发布 OpenVMT-Dataset 与 OpenVMT-Bench。若数据集和评测基准能够覆盖足够多样的对象形态,它们可能成为后续视频运动迁移研究的重要基础设施。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章