返回文章列表
世界模型

D-JEPA:让潜在世界模型更懂“该选哪个动作”

阅读约 3 分钟

导语

潜在世界模型的基本思路,是把当前状态和候选动作映射为未来表示,再根据未来表示与目标的距离选择动作。问题在于,表示空间中的距离主要反映“预测结果像不像目标”,却不一定反映“这个动作能否真正完成任务”。在候选动作数量有限、必须立即做出选择的场景中,这种偏差尤其危险:看起来离目标更近的预测未来,实际执行结果反而可能更差。

D-JEPA(Decision-Aligned Latent World Model)针对的正是这一决策局部预测 gap。它并非简单替换原有世界模型,而是在预训练预测模型的基础上,用执行结果提供的序位信息,重新调整候选未来之间的关系。

核心要点

  • 从预测准确转向决策相关。 D-JEPA关注的不是所有未来的全局几何,而是当前真正参与竞争的少量候选动作,并学习它们哪一个更可能带来成功执行。
  • 利用结果监督排序。 方法从已执行动作的结果中提取ordinal evidence,也就是候选未来之间的相对优先级,再将其与目标相关的预测特征结合起来。
  • 进行受限的关系校准。 一个有界、对候选排列保持等变的算子负责生成修正,尽量保留预训练模型已有的预测能力,只在决策最关键的区域调整潜在几何。
  • 融合不同预测几何。 论文还设计了共享的序位接口,使对齐过程能够跨越互补的预测表示,而不必把所有模型强行压缩到同一种几何中。
  • 兼容原生规划流程。 对齐后的决策结构被进一步实现为JEPA兼容的未来表示,因此部署时仍可使用潜在距离进行规划,而不需要完全改写控制器。

评测与意义

素材显示,D-JEPA覆盖潜在控制、机器人操作、预训练动作生成模型、实体机器人和自动驾驶等场景。在PushT确认评测中,成功率达到87.89%;在RoboTwin上,平均提升15.04个百分点;实体机器人任务则提升17个百分点。上述结果说明,改进重点不只是让模型“预测得更像”,还在于让潜在空间的比较结果更贴近实际决策。

这一方向对世界模型落地具有现实意义。机器人和自动驾驶系统往往无法穷举所有行动,也不能承受一次错误选择。若模型能够从执行反馈中学习候选未来的相对价值,就有机会弥合表征学习与控制之间的断层。不过,D-JEPA的效果仍依赖决策监督、候选动作分布以及预训练预测几何;它更像是对现有世界模型的针对性校准,而非脱离数据和基础模型的通用解决方案。

总体看,D-JEPA提出了一个清晰的判断标准:世界模型不仅要描述可能发生什么,还要帮助系统区分哪些可能性值得执行。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
WorldPlay2:用分层控制与压缩记忆推进实时交互世界模型
世界模型
cctest.ai
世界模型

WorldPlay2:用分层控制与压缩记忆推进实时交互世界模型

WorldPlay2 面向实时交互世界模型中的两大难题:控制形式复杂,以及长时滚动中的上下文膨胀与一致性下降。论文通过混合控制接口、共享记忆令牌和 Stable Forcing 蒸馏策略,试图在响应速度与长期稳定性之间取得平衡。

阅读全文
CCTest · Blog
InternW0-Δ:用20K小时开放数据连接视觉预测与机器人动作
世界模型
cctest.ai
世界模型

InternW0-Δ:用20K小时开放数据连接视觉预测与机器人动作

InternW0-Δ试图把视觉动态、场景语义、几何运动先验与动作生成整合进同一个世界动作模型,并以超过2万小时的异构开放数据进行预训练。论文称,该模型在仿真基准和真实机器人平台上均取得了优于既有方法的表现。

阅读全文