返回文章列表
世界模型

JEPA-TTT:让世界模型在测试阶段持续适应动力学变化

阅读约 2 分钟

导语

世界模型的价值,在于让智能体先预测未来,再据此选择动作。但如果测试环境的摩擦、质量、控制响应等动力学规律与训练阶段不同,原本准确的预测就可能迅速失效。来自约翰斯·霍普金斯大学等机构的研究提出 JEPA-TTT,尝试让预训练世界模型在部署后继续学习,从而应对这类动力学偏移。

核心方法

JEPA-TTT 建立在动作条件的 JEPA(Joint-Embedding Predictive Architecture)世界模型之上。它没有重新训练整个模型,而是采取较为克制的更新策略:

  • 只调整潜在动力学预测器:视觉编码器保持冻结,避免测试数据改变已经学到的视觉表示;奖励头也不更新,以保留原有任务目标。
  • 利用自监督信号适应环境:智能体通过与环境交互获得连续观测,并用真实后续状态来训练潜在预测器,不需要在线环境奖励或目标图像。
  • 采用密集回放:对一段轨迹中的每个时间偏移都构造预测窗口,将这些窗口放入持续增长的缓冲区,再从中采样小批量更新模型。
  • 跨回合积累经验:更新并非只在单个回合内生效,而是持续累积,使模型能够逐步适应测试期间反复出现的动力学规律。

这种设计把“规划模型”和“适应模块”分开:前者保留预训练知识,后者专门修正环境变化带来的预测误差。由于更新发生在潜在空间,方法也不必直接重建完整图像序列。

实验结果与意义

研究在四个连续控制环境中测试了八种动力学变化。JEPA-TTT 在每一种变化下都优于保持冻结的 JEPA 世界模型。经过 500 个测试回合后,模型的自回归潜在预测误差平均降低 83%,规划性能相对冻结基线提升 153%。这些结果表明,测试时训练并不一定要依赖人工奖励;只要能够获得连续观测,就可以利用预测一致性形成适应信号。

更重要的是,这项工作将世界模型的部署过程从“一次训练、固定使用”推进到“边运行、边校准”。不过,持续更新也带来新的问题:环境变化是否足够稳定、缓冲区中的旧经验是否会干扰新规律,以及模型在分布持续漂移时能否避免遗忘,都仍需要进一步评估。当前结果主要来自连续控制环境,因此其方法能否直接扩展到更复杂、开放式的视觉任务,还有待更多实验验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章