返回文章列表
模型评测

Principia:用物体间关系检验视频模型是否真的懂物理

阅读约 3 分钟

导语

视频生成模型正在变得越来越逼真,但“看起来合理”并不等于“遵守物理规律”。一个物体可能沿着自然的轨迹移动,碰撞画面也可能足够流畅,然而只要把场景中的多个物体放在一起比较,就会暴露出加速度、反弹或能量变化不一致的问题。

来自 Principia 的研究提出了一个重要转向:不再试图从生成视频中直接测量绝对速度、距离或真实重力,而是观察同一场景中两个物体之间是否满足应有的运动关系。

核心方法:从绝对测量转向关系一致性

评估生成视频的物理真实性,通常会受到帧率、物体实际尺寸、镜头焦距和相机标定等因素影响。这些信息在生成视频中往往并不存在,导致许多绝对数值难以可靠恢复。

Principia 利用成对物体共享同一物理规律这一事实。例如,在相同环境下运动的物体,其运动变化应当呈现可预测的相对关系;发生碰撞的两个物体,其反弹表现也不应彼此矛盾。研究团队据此设计了与标定无关的一致性评分,直接在图像空间中衡量物理规律被违反的程度。

覆盖八类牛顿力学现象

基准使用受控协议录制的真实世界场景,考察范围横跨多种动力学类型:

  • 重力与抛体运动,关注物体下落及飞行轨迹之间的关系;
  • 碰撞恢复、摩擦和动量,检验碰撞后的速度与运动变化是否协调;
  • 转动惯量,考察旋转物体的动态表现;
  • 摆和质量—弹簧振子,评估周期性与振荡过程的一致性。

这些任务覆盖平动、转动、碰撞和振荡,使评测不再局限于单一的“物体是否会下落”测试。

结果揭示:视觉逼真不等于物理可靠

研究者在六种先进视频生成模型上进行了数千次生成测试。结果显示,没有任何模型在 Principia 上超过 0.42;与此同时,这些模型在 VBench 上的得分都约为 0.8。两类指标之间的明显差距说明,通用视频质量评测能够认可画面外观、运动连贯性等表现,却未必能发现更深层的物理关系错误。

研究还测试了视觉语言模型识别物理违规的能力。表现最佳的模型准确率为 67%,多数模型则接近随机水平。这意味着,当前模型不仅可能生成错误物理过程,也未必能稳定地指出错误发生在哪里。

意义与影响

Principia 的价值不只是新增一个排行榜,而是提供了一种更适合生成视频的评测思路:当真实尺度和相机参数不可得时,可以优先检查关系是否成立。对于视频生成模型训练,这类指标有望帮助研究者定位碰撞、旋转和周期运动中的系统性缺陷;对于多模态模型,也能检验其是否真正理解动态过程,而不是依赖静态外观或语言常识作答。

当然,现有结果只反映了该基准覆盖的物理现象和受控场景。它不能单独代表模型对所有现实世界动力学的理解,但足以提醒业界:视频模型的下一阶段竞争,不能只看画面是否逼真,还要看画面中的世界是否自洽。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口
模型评测
cctest.ai
模型评测

代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口

ExecRetrieval构建了包含近乎相同但实际有错代码的检索基准,专门测试代码嵌入能否把正确实现排在错误变体之前。结果显示,模型在扩大召回范围后表现很好,但首位排序仍存在明显功能性缺口。

阅读全文