返回文章列表
模型评测

Apple-PI:给视频模型做“物理推理”体检的首个基准

阅读约 2 分钟

近几年,视频生成模型常被描述为“世界模型”,仿佛已经能够理解现实世界的运动规律。但如果只看生成结果是否合理,并不能证明模型真的掌握了物理知识。Apple-PI 正是在这个背景下提出的:它不再只评估“看起来对不对”,而是尝试判断模型是否按照物理定律完成了推理。

这项工作做了什么

Apple-PI 由三部分组成:

  • Orchard 数据集:包含 400 个视频样本,覆盖经典力学中的 10 类典型任务。
  • 三阶段评测协议:按照科学推理流程拆成 Perception(感知)Formulation(表述)Deduction(推导) 三步。
  • 混合评测套件:结合 MLLM 的主观评分与基于物理定律的客观指标,既看结果,也看过程。

其中一个重要设计是链式帧提示:研究者在带有信息图标注的首帧上引导模型逐步生成视频,把生成过程当作模型的“可见推理轨迹”。这样一来,评测不只是知道模型错了,还能进一步定位它错在了哪一步。

为什么重要

这项研究的价值在于,它把视频生成从“视觉逼真度竞争”推进到“物理一致性诊断”。作者把任务分成单一物理规律和多重物理规律两类:前者便于排除干扰因素,后者用于检验泛化能力。这样的划分让基准更接近真实研究场景,也更有助于分析模型到底学到了什么。

论文对 11 个模型的测试显示,当前系统离“可靠的、基于定律的世界模拟器”还有距离;表现最好的视频模型得分也只有 0.473。进一步分析还暴露出几个关键问题:

  1. 感知到表述再到推导之间存在明显瓶颈;
  2. 多定律状态迁移能力偏弱;
  3. 模型在模拟场景与真实物理之间仍有持续的 Sim-to-Real gap

影响与意义

Apple-PI 的意义不只是发布了一个新榜单,更重要的是提供了一套诊断框架。它让研究者能够看到模型究竟是“没看懂画面”,还是“看懂了但不会写成物理规则”,又或者是“能说出规则却推不出正确结果”。这种分层分析对后续改进视频模型、世界模型和具身智能系统都很有参考价值。

如果未来视频模型真的要成为可信的物理世界模拟器,那么评测标准也必须从结果导向,走向“推理是否忠于定律”的过程导向。Apple-PI 提供了这样一个起点。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章