Principia:用物体间关系检验视频模型是否真的懂物理
导语
视频生成模型正在变得越来越逼真,但“看起来合理”并不等于“遵守物理规律”。一个物体可能沿着自然的轨迹移动,碰撞画面也可能足够流畅,然而只要把场景中的多个物体放在一起比较,就会暴露出加速度、反弹或能量变化不一致的问题。
来自 Principia 的研究提出了一个重要转向:不再试图从生成视频中直接测量绝对速度、距离或真实重力,而是观察同一场景中两个物体之间是否满足应有的运动关系。
核心方法:从绝对测量转向关系一致性
评估生成视频的物理真实性,通常会受到帧率、物体实际尺寸、镜头焦距和相机标定等因素影响。这些信息在生成视频中往往并不存在,导致许多绝对数值难以可靠恢复。
Principia 利用成对物体共享同一物理规律这一事实。例如,在相同环境下运动的物体,其运动变化应当呈现可预测的相对关系;发生碰撞的两个物体,其反弹表现也不应彼此矛盾。研究团队据此设计了与标定无关的一致性评分,直接在图像空间中衡量物理规律被违反的程度。
覆盖八类牛顿力学现象
基准使用受控协议录制的真实世界场景,考察范围横跨多种动力学类型:
- 重力与抛体运动,关注物体下落及飞行轨迹之间的关系;
- 碰撞恢复、摩擦和动量,检验碰撞后的速度与运动变化是否协调;
- 转动惯量,考察旋转物体的动态表现;
- 摆和质量—弹簧振子,评估周期性与振荡过程的一致性。
这些任务覆盖平动、转动、碰撞和振荡,使评测不再局限于单一的“物体是否会下落”测试。
结果揭示:视觉逼真不等于物理可靠
研究者在六种先进视频生成模型上进行了数千次生成测试。结果显示,没有任何模型在 Principia 上超过 0.42;与此同时,这些模型在 VBench 上的得分都约为 0.8。两类指标之间的明显差距说明,通用视频质量评测能够认可画面外观、运动连贯性等表现,却未必能发现更深层的物理关系错误。
研究还测试了视觉语言模型识别物理违规的能力。表现最佳的模型准确率为 67%,多数模型则接近随机水平。这意味着,当前模型不仅可能生成错误物理过程,也未必能稳定地指出错误发生在哪里。
意义与影响
Principia 的价值不只是新增一个排行榜,而是提供了一种更适合生成视频的评测思路:当真实尺度和相机参数不可得时,可以优先检查关系是否成立。对于视频生成模型训练,这类指标有望帮助研究者定位碰撞、旋转和周期运动中的系统性缺陷;对于多模态模型,也能检验其是否真正理解动态过程,而不是依赖静态外观或语言常识作答。
当然,现有结果只反映了该基准覆盖的物理现象和受控场景。它不能单独代表模型对所有现实世界动力学的理解,但足以提醒业界:视频模型的下一阶段竞争,不能只看画面是否逼真,还要看画面中的世界是否自洽。
评论
正在确认登录状态……
正在加载评论……