Physis-Lang:用可进化的物理语言提升视频世界模型
导语
视频世界模型的目标,不只是生成看起来连贯的画面,还要预测物体和环境将如何按照物理规律变化。现实中,模型可能生成视觉上逼真的碰撞、坠落或流体运动,却在因果关系、时间顺序和作用结果上出现错误。Physis-Lang 的提出,代表了一种不同于额外引入潜变量、数值信号或显式规划模块的思路:重新提高语言在物理表示中的作用。
核心要点
- 把物理过程写成更完整的语言表示。 Physis-Lang 不满足于“某物体移动”这类表面描述,而是要求语言覆盖相关实体、原因、相互作用、支配规律、时间演化和最终效果。这样的视频文本不只是内容标签,也承担了过程建模的职责。
- 用 PhysCapBench 检查描述是否真正有用。 该基准将物理过程拆分为原子级断言,并从召回率和精确率两个角度评估 caption。模型需要尽可能覆盖关键过程,同时避免添加视频中不存在或不成立的物理信息。
- 通过代理循环持续修正提示。 系统会分析断言层面的遗漏和错误,再改进生成物理 caption 所使用的指令。语言表示因此不再是一次性人工设计,而是可以依据评估结果迭代优化。
- 让数据选择也受物理缺陷驱动。 Physis-Lang 将模型表现不佳的地方转写为文本描述,再利用语言引导检索寻找能够覆盖缺失物理过程、且视觉内容更加多样的视频。这使数据整理与模型生成形成反馈闭环。
实验与意义
研究团队在四个常用物理视频基准上,使用 Wan 和 Cosmos 作为骨干模型进行验证。素材显示,Physis-Lang 在这些设置下持续提升了物理合理性。尤其值得关注的是,以开源 Cosmos3-Nano 为基础的增强模型,在论文报告的比较中超过了专有 Veo 3.1 模型。
这项工作的价值并不只在于增加一套 caption 模板,而在于把语言同时放在数据、训练和生成三个位置:它既用于描述问题,也用于发现数据缺口,还用于指导模型表达物理过程。若这一方向得到进一步验证,视频世界模型的改进可能不必完全依赖更大的视觉编码器或更复杂的隐式表示,细粒度、可评估、可迭代的语言监督也能成为重要杠杆。
当然,当前结论主要来自论文所列的物理视频基准和模型组合。物理语言能否稳定覆盖更复杂的三维交互、长时序演化及开放世界场景,还需要更多实验检验。总体而言,Physis-Lang 提供了一个清晰的研究命题:提升世界模型的物理一致性,关键可能不仅是让模型看到更多视频,也要让它更准确地说清楚视频中的物理过程。
评论
正在确认登录状态……
正在加载评论……