给世界模型补上“物体恒存”:WROP如何训练视频模型理解遮挡与连续性
导语
当一个球滚到遮挡物后面,人类通常会自然地认为它仍然存在,并根据运动轨迹推断它可能从哪里出现。这种“物体恒存”能力看似基础,却是理解世界连续性、进行物理预测和规划行动的重要认知前提。论文《Training Object Permanence in World Models》关注的问题是:当前视频生成模型是否已经具备这种能力?如果没有,能否通过专门设计的数据进行训练?
核心方法:把认知任务变成可规模化数据
研究团队提出WROP(World Reasoning with Object Permanence),将物体恒存和实体坚固性相关问题组织为150个受认知科学启发的任务,并划分为六类认知范畴。任务并非只依赖少量人工视频,而是配套开发了基于Blender的生成器,在保持任务认知结构不变的情况下,随机改变速度、光照、相机角度等干扰因素。
这种设计的重点,是让模型不能简单记住某个固定画面或运动模板,而需要关注遮挡、位置变化和物体连续性等更核心的关系。每项任务可生成至少1万条样本,最终形成约150万条训练数据。团队还发布了一个包含300道题的测试集,用于比较不同视频模型在这些能力上的表现。
评测结果:训练有效,但能力边界仍需区分
研究对14个视频模型进行了评估,包括3个参考图像到视频模型、7个视频编辑模型和4个视频续写模型。其中,PWM-WROP是一款规模为160亿参数的世界模型。通过盲测两两比较并计算Elo分数,PWM-WROP在视频续写模型中排名第一,整体排名第三;排在前两位的两个参考图像到视频模型之间则处于统计上的平局。
这一结果说明,围绕核心认知概念构建结构化数据,可能比单纯扩大通用视频数据更直接地改善某些世界建模能力。不过,论文的结论应限定在其设计的任务和评测框架内。模型在WROP测试中的表现,并不等同于已经获得普适的物理常识,也不能单凭排名证明其具备人类水平的推理或现实环境交互能力。
意义与影响
WROP的价值首先在于提供了一套可复用的研究基础设施:任务定义、程序化数据生成、训练语料和标准化考试被放在同一框架中,便于后续研究比较模型是否真正学会了某类认知规律。其次,它提示世界模型训练可以借鉴心理学和认知科学,将“连续性”“遮挡推理”等抽象能力拆成可验证的任务。
团队同时开放数据、试题、模型答案、分数、权重,以及基于原生PyTorch、面向AWS Trainium2的训练栈。未来更关键的问题,是这些能力能否迁移到未见过的场景、真实视频和机器人交互中,而不是只在合成任务上取得更高分。
评论
正在确认登录状态……
正在加载评论……