返回文章列表
世界模型

JEPA世界模型的关键不只是预测,更是规划时如何衡量误差

阅读约 3 分钟

导语

在基于模型的强化学习中,世界模型的职责不只是“预测下一状态”,还要帮助规划器判断哪条动作序列更值得执行。JEPA类世界模型通常把观测压缩到潜空间,再学习动作条件下的状态转移;规划时,则用预测终点与目标表示之间的欧氏距离为候选动作排序。这个流程看似直接,却隐藏着一个容易被忽略的问题:潜空间中的“近”和“远”,是否真的对应任务中的“好”和“坏”?

核心问题:表示学得准,不等于代价函数合理

论文《Anisotropic Representations Improve Planning in JEPA World Models》指出,预测准确、表示不发生坍塌,并不能保证潜空间的几何结构与任务目标对齐。常见的各向同性高斯正则会倾向于让各个表示维度具有相近的尺度,但任务中的不同因素可能并不等价。结果是,某些对控制结果更关键的误差被低估,另一些不太重要的差异却被放大,规划器因而可能错误地给可行结果排序。

这一观察把问题从“模型能否预测”推进到“模型如何衡量预测误差”。在终点状态由多个因素共同决定的控制任务中,表示几何本身实际上就是规划代价的一部分。

方法:让表示空间具备方向性

作者提出AnisoWM,并配套设计ΛReg。它不再使用固定的各向同性高斯目标,而是学习一个对角协方差,为不同潜变量维度分配不同的方差。训练过程同时施加固定迹和各向异性约束,避免模型通过无限放大或缩小某些维度来获得不稳定解。

值得注意的是,改动集中在训练目标的统计结构上:预测目标、预测器架构以及规划阶段使用的欧氏距离都保持不变。也就是说,方法并没有额外引入复杂的规划器,而是试图让训练得到的表示本身携带更适合规划的度量。论文还分析了方差如何受到预测难度和训练数据分布影响,以及在什么条件下,这种度量能够降低规划遗憾。

实验与意义

在四个视觉控制环境中,AnisoWM的规划成功率均优于LeWorldModel;同时,其潜在规划代价与实际任务结果表现出更好的一致性。素材没有提供各环境的具体名称和数值,因此更稳妥的解读是:改进并非来自更换规划算法,而主要来自对表示几何的重新塑造。

这项工作提示,世界模型评估不能只看预测误差或表示是否坍塌。对于需要模型进行决策的系统,还应检查潜空间距离能否正确区分不同结果。未来,表示学习与规划目标之间的对齐,可能会成为JEPA世界模型的重要设计维度;固定的归一化假设,也可能需要根据任务结构被重新审视。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
WorldPlay2:用分层控制与压缩记忆推进实时交互世界模型
世界模型
cctest.ai
世界模型

WorldPlay2:用分层控制与压缩记忆推进实时交互世界模型

WorldPlay2 面向实时交互世界模型中的两大难题:控制形式复杂,以及长时滚动中的上下文膨胀与一致性下降。论文通过混合控制接口、共享记忆令牌和 Stable Forcing 蒸馏策略,试图在响应速度与长期稳定性之间取得平衡。

阅读全文