返回文章列表
视觉与视频

VideoPhysEdit:让视频编辑预测“改动之后会发生什么”

阅读约 3 分钟

导语

现有视频编辑系统已经能够处理物体外观、阴影、遮挡和局部替换,但“改动发生之后会怎样”仍是一个更难的问题。比如在某一帧移走一个物体,后续碰撞、滚动、掉落和遮挡关系都可能改变。若模型只修改当前画面,却没有重建后续因果过程,生成的视频即使看起来连贯,也可能违背基本物理规律。

VideoPhysEdit 将这一问题定义为“物理反事实视频编辑”(Physical Counterfactual Video Editing,PCVE):给定源视频、一次物理编辑以及编辑发生的时间点,系统需要生成一个反事实视频,展示干预之后可能出现的运动与交互结果。论文聚焦刚体场景,并提出了一套不依赖额外训练的处理流程。

核心方法:先重建,再干预

VideoPhysEdit 的关键并不是直接让视频生成模型猜测未来,而是显式引入物理推理。系统首先从输入视频中恢复一个能够在模拟环境里复现原始运动和交互的物理场景。这个场景需要包含刚体的几何、姿态、运动状态以及相关物理关系,使模拟结果尽可能贴近视频中观察到的过程。

在此基础上,用户可以指定编辑类型和执行帧,把编辑视为一次物理干预。系统随后在重建场景中运行干预后的模拟,获得物体未来运动和相互作用的轨迹,再将这些轨迹用于引导反事实视频生成。换言之,生成模型负责呈现画面,物理模拟则为“接下来应该怎么动”提供约束。

评测不只看画质

论文还构建了 PCVE-RigidBench。该基准包含成对的源视频与反事实目标视频,并提供物理真值,便于检查一次编辑是否真正改变了预期的后续过程,而不是只改变局部外观。作者同时提出 Physical Edit Score,用于衡量物理编辑准确性。

根据论文摘要,VideoPhysEdit 在该指标上的得分为 0.376,在物理编辑准确性方面明显优于参与比较的开源方法和商业模型,同时保持具有竞争力的视觉保真度。需要注意的是,这一结果建立在刚体场景和合成基准之上,并不等同于已经解决复杂现实世界视频中的通用物理推理。

意义与局限

VideoPhysEdit 的价值在于把视频编辑从“画面重绘”进一步连接到“可执行的场景干预”。对于影视预演、机器人数据生成、交互式内容创作和世界模型评测,这种因果一致性可能比单帧逼真更重要。它也说明,在当前视频生成模型难以稳定学习长程物理关系时,显式重建与模拟可以成为一种有效的中间层。

不过,刚体假设仍限制了方法的适用范围。柔性物体、流体、复杂接触以及现实拍摄中的遮挡和深度不确定性,都会增加场景重建难度。未来的关键问题,是如何把这种“物理模拟提供轨迹、生成模型负责视觉呈现”的思路扩展到更丰富的场景,并建立覆盖真实视频的评测体系。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章