返回文章列表
世界模型

给世界模型补上“物体恒存”:WROP如何训练视频模型理解遮挡与连续性

阅读约 3 分钟

导语

当一个球滚到遮挡物后面,人类通常会自然地认为它仍然存在,并根据运动轨迹推断它可能从哪里出现。这种“物体恒存”能力看似基础,却是理解世界连续性、进行物理预测和规划行动的重要认知前提。论文《Training Object Permanence in World Models》关注的问题是:当前视频生成模型是否已经具备这种能力?如果没有,能否通过专门设计的数据进行训练?

核心方法:把认知任务变成可规模化数据

研究团队提出WROP(World Reasoning with Object Permanence),将物体恒存和实体坚固性相关问题组织为150个受认知科学启发的任务,并划分为六类认知范畴。任务并非只依赖少量人工视频,而是配套开发了基于Blender的生成器,在保持任务认知结构不变的情况下,随机改变速度、光照、相机角度等干扰因素。

这种设计的重点,是让模型不能简单记住某个固定画面或运动模板,而需要关注遮挡、位置变化和物体连续性等更核心的关系。每项任务可生成至少1万条样本,最终形成约150万条训练数据。团队还发布了一个包含300道题的测试集,用于比较不同视频模型在这些能力上的表现。

评测结果:训练有效,但能力边界仍需区分

研究对14个视频模型进行了评估,包括3个参考图像到视频模型、7个视频编辑模型和4个视频续写模型。其中,PWM-WROP是一款规模为160亿参数的世界模型。通过盲测两两比较并计算Elo分数,PWM-WROP在视频续写模型中排名第一,整体排名第三;排在前两位的两个参考图像到视频模型之间则处于统计上的平局。

这一结果说明,围绕核心认知概念构建结构化数据,可能比单纯扩大通用视频数据更直接地改善某些世界建模能力。不过,论文的结论应限定在其设计的任务和评测框架内。模型在WROP测试中的表现,并不等同于已经获得普适的物理常识,也不能单凭排名证明其具备人类水平的推理或现实环境交互能力。

意义与影响

WROP的价值首先在于提供了一套可复用的研究基础设施:任务定义、程序化数据生成、训练语料和标准化考试被放在同一框架中,便于后续研究比较模型是否真正学会了某类认知规律。其次,它提示世界模型训练可以借鉴心理学和认知科学,将“连续性”“遮挡推理”等抽象能力拆成可验证的任务。

团队同时开放数据、试题、模型答案、分数、权重,以及基于原生PyTorch、面向AWS Trainium2的训练栈。未来更关键的问题,是这些能力能否迁移到未见过的场景、真实视频和机器人交互中,而不是只在合成任务上取得更高分。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
HappyWorld-Bench:从“看起来真实”到“交互可靠”的世界模型评测
世界模型
cctest.ai
世界模型

HappyWorld-Bench:从“看起来真实”到“交互可靠”的世界模型评测

HappyWorld-Bench提出了一套覆盖视频、空间与具身系统的统一评测框架,重点检验世界模型在探索、交互和修改后的状态一致性与行为响应能力。结果显示,当前系统仍普遍存在长期一致性不足、编辑执行偏差和多步状态保持困难。

阅读全文