返回文章列表
机器人与物理 AI

Ego2Robot:把第一人称人类视频变成机器人训练数据的可扩展方案

阅读约 2 分钟

导语

机器人操作模型要想真正“会泛化”,不能只看少量标准示范,而需要海量、丰富且多样的数据。Ego2Robot 试图回答一个关键问题:第一人称人类操作视频,能否不只是做小规模任务适配,而是成为机器人基础模型的预训练资源?

核心要点

  • 把人类视频转成机器人格式数据:流程包括动作重定向、机器人手臂视觉合成,以及多层质量筛选。
  • 数据来源更广:既覆盖整理过的数据集,也支持真实环境中的公开视频。
  • 规模明显提升:论文给出的数据规模达到 18,561 小时,覆盖 15 种机器人形态,是目前作者所述最大规模的 ego-to-robot 数据集。
  • 评测更关注泛化:作者扩展 RoboTwin2.0,加入视觉外观、场景布局、机器人形态和任务语义等可分离扰动轴,用来检验模型在不同变化下的稳定性。
  • 联合预训练有效:实验表明,把 Ego2Robot 合成数据与真实机器人数据一起做预训练,能持续改善分布外泛化,并且这一收益在真实机器人部署中也得到了验证。

这项工作的意义

Ego2Robot 的价值不只是“造出更多数据”,而是提供了一种可扩展的数据合成思路:把大量自然发生的人类操作行为,转换成更接近机器人学习需求的格式。对于机器人基础模型来说,这意味着预训练数据不必完全依赖昂贵的机器人采集,也可以从人类日常操作视频中持续挖掘。

同时,论文把“泛化”拆成多个维度来测,这一点很重要。机器人系统常常在外观变化、场景变化、机体差异或任务语义变化下失效,单一基准很难说明模型是否真的稳健。Ego2Robot 的实验结果说明,合成数据并不只是补充样本量,也可能成为提升跨场景能力的有效预训练信号。

结论

如果这一方向继续成熟,未来机器人数据生产的重点可能不再只是“手工采集”,而会转向“从人类行为中规模化提炼可训练经验”。Ego2Robot 给出的,是一条更接近基础模型时代的数据工程路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
自动驾驶 VLM 的“未来轨迹泄题”问题:DEFT-RLVR 用选择题重构可验证推理
机器人与物理 AI
cctest.ai
机器人与物理 AI

自动驾驶 VLM 的“未来轨迹泄题”问题:DEFT-RLVR 用选择题重构可验证推理

这篇论文指出,自动驾驶 VLM 在用链式思维监督训练时,如果提前看到真实未来轨迹,可能学到的是事后合理化,而不是真正基于场景证据推理。作者提出 AD-MCQ 与 DEFT-RLVR,把轨迹从决策前提示改为决策后验证目标。

阅读全文