返回文章列表
模型评测

VeriPhy:让生成视频的物理可靠性变得可追溯

阅读约 3 分钟

生成视频越来越擅长制造“看起来正确”的画面,但视觉流畅并不等于物理可靠。一个物体可能在空间中瞬移,数量在镜头切换后发生变化,动作顺序也可能违背提示词要求。若评估系统只给出一个整体质量分数,开发者很难知道究竟是哪条要求被违反、错误发生在何时,更无法将诊断结果反馈给生成模型。

VeriPhy 的核心思路,是把视频评估从主观打分转化为可检查、可追溯的验证流程。系统首先只根据文本提示词,生成带类型的物理义务,例如对象是否出现、数量是否一致、位置关系是否成立,以及某个事件是否按要求发生。随后,规划器在观察视频帧之前编译出经过静态验证的执行计划,限定后续可以调用哪些分析工具以及这些工具服务于哪些声明。

执行阶段并非让一个多模态模型自由发挥,而是由观察结果触发已经声明的专家调用。相关工具包括分割与跟踪、计数、深度分析、OCR、音频事件检测,以及针对轨迹的11类物理测量。每次调用都会生成携带来源信息的证据记录。可用结果必须是有明确类型的测量,或者被明确标记为学习得到的状态,从而减少“看起来合理但无法复核”的中间结论。

核心要点

  • 先规划、后观察:提示词先被编译成物理义务和执行计划。
  • 证据带来源:每个判断都能追溯到对应工具、测量和轨迹。
  • 三值输出:系统区分“支持”“矛盾”和“未知”,分别呈现为 plausible、implausible 或 abstain,而不是强行二选一。
  • 面向真实缺陷:数据集中的人工记录定位了提示词引用、空间关系和时间过程中的具体失败。

在一个由1500个视频组成、包含人工缺陷记录的语料库中,作者进一步使用149个核心视频进行对比。这部分数据包含304条缺陷记录,VeriPhy覆盖228条;使用相同视频和声明的已发表问题分解评估器覆盖164条,而对同一骨干模型进行单体提示的方案覆盖222条。结果也说明,单看召回率并不能充分区分系统;VeriPhy真正突出的地方,是它为每个结论保留证据和 provenance,使评估轨迹能够逐条审查。

这项工作的意义不只是提高生成视频的测试分数。对于世界模型而言,评估器需要指出模型在哪个对象、哪个关系或哪个时间点失效,才能成为生成改进的接口。VeriPhy 提供的三值判断也保留了“不确定”这一现实状态,避免把证据不足误报为正确或错误。当然,素材并未说明该系统能够覆盖所有物理规律,也没有证明其在更大规模或更复杂场景中同样稳定。它更像是一种面向可解释评估的工程范式:让视频质量检查从不可复核的整体印象,转向带有明确约束、工具调用和证据链的验证过程。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口
模型评测
cctest.ai
模型评测

代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口

ExecRetrieval构建了包含近乎相同但实际有错代码的检索基准,专门测试代码嵌入能否把正确实现排在错误变体之前。结果显示,模型在扩大召回范围后表现很好,但首位排序仍存在明显功能性缺口。

阅读全文