World Embedding Benchmark:重新检验视频模型是否真正理解物理世界
导语
视频生成和世界模型正在从“画面像不像”走向“运动是否符合规律”。然而,一个视频嵌入模型能够识别物体和场景,并不意味着它真正编码了重力、碰撞、流体运动或光学变化等物理信息。为了把这一问题从直觉判断转化为可测量的评估,研究团队提出了 World Embedding Benchmark。
一个面向物理表征的基准
该基准由 8,000 个受控仿真案例组成,覆盖 80 个物理家族,领域包括流体力学、固体力学、动力学,以及光学与电磁学。每个案例都将渲染视频与来自仿真的物理标注配对。相比从真实视频中寻找难以控制的物理现象,仿真数据能够系统改变参数和视觉条件,从而更清楚地判断模型究竟捕捉到了什么。
基准设置了三类互补任务:
- 文本-视频检索:判断视频是否能与描述同一物理过程的文本匹配;
- 物理属性回归:从冻结的视频嵌入中恢复仿真产生的定量属性;
- 视频-描述配对分类:在多个候选描述中判断哪一项与视频中的物理过程相符。
这三项任务并不衡量同一件事。检索和配对分类更关注跨模态的物理对齐,属性回归则考察嵌入中是否保留了可供探针提取的数量信息。
主要发现:对齐能力与信息保留并非一回事
对预训练全模态嵌入模型的评估显示,它们在物理相关检索上的表现较弱,在同一物理家族内的配对分类中接近随机水平。这说明模型即使能生成看起来合理的视频表示,也未必能稳定地把视觉变化对应到准确的物理描述。
另一方面,轻量级探针却可以从冻结的视频嵌入中恢复有用的物理信息。换言之,物理信号可能已经存在于表示内部,只是没有被良好地组织成跨模态可检索的语义结构。这一区分对于评估世界模型尤其重要:表征“含有信息”,不等于模型“能够使用信息”。
研究还考察了使用物理领域视频-文本对进行持续对比学习的效果。训练后,检索和视频描述配对分类得到改善,但物理属性回归出现下降。这一结果揭示出一种值得关注的权衡:增强嵌入与文本的语义对齐,可能会压缩或改变原本有利于定量预测的表示结构。
对视频生成的实际价值
团队进一步将嵌入用于检索增强视频生成,为 MiniMax-H3 找到物理相关的参考视频,再将这些参考内容用于生成流程。实验表明,检索到的参考视频能够提升生成结果的物理逼真度,而且检索模型越强,带来的改善越明显。材料指出,经过物理适配的 LCO-Embedding-Omni 在这一检索增强生成实验中取得了最强表现。
这项工作提示,未来评价世界模型不能只看视频质量或文本相似度,还应同时检查物理对齐和定量属性恢复。对研究者而言,基准提供了更细的诊断工具;对生成系统而言,物理表征也可能成为连接检索、理解与生成的重要中间层。项目计划开放仿真引擎、数据集、评测代码以及训练模型,为后续研究提供可复现基础。
评论
正在确认登录状态……
正在加载评论……