返回文章列表
世界模型

RoboJEPA:机器人世界模型开始呈现可预测的规模化规律

阅读约 3 分钟

长期以来,机器人世界模型的一个关键问题不是“能不能预测未来”,而是“增加模型、数据和训练算力后,能力究竟会怎样增长”。RoboJEPA 试图为这个问题提供更系统的答案。

从像素预测转向潜在空间推演

RoboJEPA 基于联合嵌入预测架构(JEPA)。它不必逐像素生成未来画面,而是在潜在表示空间中预测未来状态,再将这些预测用于规划。这样的设计有望减少对视觉细节逐一重建的依赖,把模型容量更多用于捕捉与行动相关的变化。

论文使用覆盖 12 种机器人形态的大规模真实机器人数据进行训练,并围绕不同规模的模型、数据和计算资源开展实验。研究重点包括:

  • 用“想象误差”衡量潜在世界模型滚动预测未来状态时的偏差;
  • 观察想象误差如何随计算量变化,并以此外推更大规模模型的质量;
  • 检验该误差是否能够预测下游机器人规划表现;
  • 将模型直接部署到真实硬件,测试长时程、目标导向任务。

一个可用于扩展的测量框架

研究者报告称,RoboJEPA 的想象误差遵循关于计算量的二阶幂律。这意味着模型质量并非只能依赖在每个新规模上重新进行昂贵的真实机器人测试,部分趋势可以根据较小规模实验进行预测。论文还发现,规划性能会随计算量呈现可预测改善,并且与想象误差高度相关。

如果这一关系在更多任务和机器人平台上成立,想象误差就可能成为现实机器人评测的代理指标:研究者可以先在模型内部评估潜在轨迹,再决定是否进行成本更高、风险更高的实体机器人实验。不过,素材并未说明该规律适用于所有任务,因此它更适合作为评测线索,而不是万能替代品。

从世界模型到零样本机器人代理

RoboJEPA 还展示了潜在世界模型的另一种使用方式:机器人可以围绕一张目标图像进行规划,在真实硬件上处理需要较长行动链的任务。这里的重点并不是让模型直接模仿固定动作,而是让它在内部预测可能的未来状态,并据此选择行动。

论文将 8B 参数版本称为目前规模最大的 JEPA predictor,并公开模型检查点、训练代码和机器人部署代码。其价值在于把“世界模型是否会随规模变强”从经验判断推进到可测量的缩放问题,同时也为跨形态机器人数据训练提供了一个开放基线。后续仍需验证这些幂律关系在更多环境、任务和硬件上的稳定性,以及潜在预测误差与实际成功率之间的边界。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
WorldGuide:让视频世界模型从“生成画面”走向“执行任务”
世界模型
cctest.ai
世界模型

WorldGuide:让视频世界模型从“生成画面”走向“执行任务”

WorldGuide 将程序化视频生成建模为一个闭环任务执行过程:模型根据当前视觉状态规划下一步原子动作,生成对应视频,再依据结果继续执行或结束任务。研究团队同时推出包含约 5.9 万段分步标注视频的 WorldGuide Bench。

阅读全文