返回文章列表
模型评测

VGI-Bench:视频生成模型真的具备视觉推理能力吗?

阅读约 3 分钟

导语

视频生成模型的竞争,正在从“画面是否逼真”转向“是否理解画面为何这样变化”。一个模型能够生成漂亮的视频,并不意味着它掌握了物体关系、空间变化或因果过程。论文《VGI-Bench: Probing Visual Intelligence in Video Generation Models》提出了一套专门的评测基准,试图回答一个更基础的问题:视频生成模型究竟在多大程度上具备视觉智能?

从静态结果转向动态过程

VGI-Bench 包含 27 个任务、810 个实例,并按照任务领域和技能标签进行两层组织。与只检查最后一帧是否“看起来正确”的评测不同,该基准要求模型生成有效、连贯的演化过程。也就是说,模型不仅要达到某种结果,还要让中间发生的变化符合视觉逻辑。

这一设计切中了视频生成模型的关键弱点:它们可能凭借数据先验生成一个合理的终态,却无法稳定解释物体如何移动、关系如何改变,以及过程中的状态转换是否成立。基准还特别关注输入是否符合当前视频模型熟悉的视觉先验,并尝试控制任务难度,使问题既具有挑战性,也保留一定可完成空间。

评测暴露出的局限

论文结果显示,现有生成系统确实能够解决部分视觉接地的推理任务,但整体可靠性仍然不足。即使表现最好的 Seedance 2.0,按照论文评测标准也只达到 51.0%。这个结果并非简单说明模型“不会推理”,而是表明其能力高度不均衡:在某些模式化任务上可以给出有效输出,面对更复杂的动态约束时却容易失稳。

研究还分析了几类影响因素:

  • 输出可能在视觉上连贯,却没有真正满足任务要求;
  • 模型对输入条件和视觉呈现方式较为敏感;
  • 通过合成数据微调获得的能力存在迁移边界,不能自然推广到所有任务;
  • 从内部去噪过程观察,后续步骤更多是在细化早期假设,而不是主动纠正推理错误。

意义与影响

VGI-Bench 的价值在于,它把视频生成评测从感知质量进一步推向过程有效性和视觉推理可靠性。对于模型开发者而言,单纯扩大数据或提升画面细节,并不能自动解决过程规划、状态跟踪和错误修正问题。未来的视频生成模型可能需要更明确的中间表示、更强的时空记忆,以及能够在生成过程中重新检查假设的机制。

对研究社区来说,这一基准也提供了一个更细粒度的比较框架:模型不再只有“会生成”和“不会生成”两种结论,而可以进一步定位其在哪些视觉技能上有效、在哪些动态推理环节失败。随着视频模型逐渐承担模拟、交互和世界建模任务,这类面向视觉智能的评测或将成为衡量模型进步的重要补充。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章