返回文章列表
机器人与物理 AI

Ego2Robot:把第一人称人类视频变成机器人训练数据的可扩展方案

阅读约 2 分钟

导语

机器人操作模型要想真正“会泛化”,不能只看少量标准示范,而需要海量、丰富且多样的数据。Ego2Robot 试图回答一个关键问题:第一人称人类操作视频,能否不只是做小规模任务适配,而是成为机器人基础模型的预训练资源?

核心要点

  • 把人类视频转成机器人格式数据:流程包括动作重定向、机器人手臂视觉合成,以及多层质量筛选。
  • 数据来源更广:既覆盖整理过的数据集,也支持真实环境中的公开视频。
  • 规模明显提升:论文给出的数据规模达到 18,561 小时,覆盖 15 种机器人形态,是目前作者所述最大规模的 ego-to-robot 数据集。
  • 评测更关注泛化:作者扩展 RoboTwin2.0,加入视觉外观、场景布局、机器人形态和任务语义等可分离扰动轴,用来检验模型在不同变化下的稳定性。
  • 联合预训练有效:实验表明,把 Ego2Robot 合成数据与真实机器人数据一起做预训练,能持续改善分布外泛化,并且这一收益在真实机器人部署中也得到了验证。

这项工作的意义

Ego2Robot 的价值不只是“造出更多数据”,而是提供了一种可扩展的数据合成思路:把大量自然发生的人类操作行为,转换成更接近机器人学习需求的格式。对于机器人基础模型来说,这意味着预训练数据不必完全依赖昂贵的机器人采集,也可以从人类日常操作视频中持续挖掘。

同时,论文把“泛化”拆成多个维度来测,这一点很重要。机器人系统常常在外观变化、场景变化、机体差异或任务语义变化下失效,单一基准很难说明模型是否真的稳健。Ego2Robot 的实验结果说明,合成数据并不只是补充样本量,也可能成为提升跨场景能力的有效预训练信号。

结论

如果这一方向继续成熟,未来机器人数据生产的重点可能不再只是“手工采集”,而会转向“从人类行为中规模化提炼可训练经验”。Ego2Robot 给出的,是一条更接近基础模型时代的数据工程路径。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
VABench:让多模态模型在真实空间中看、想、做与纠错
机器人与物理 AI
cctest.ai
机器人与物理 AI

VABench:让多模态模型在真实空间中看、想、做与纠错

VABench 不再只考察模型能否说出物体在哪里,而是进一步测试其在信息不完整时主动观察、建立空间关系、发出精确动作并依据反馈修正的能力。结果显示,模型在定位等基础能力上表现较好,但距离稳定完成复杂操作仍有明显差距。

阅读全文
CCTest · Blog
GPT-Policy:让机器人在部署现场从上下文中学习
机器人与物理 AI
cctest.ai
机器人与物理 AI

GPT-Policy:让机器人在部署现场从上下文中学习

GPT-Policy 将视觉语言模型、上下文编译器与受约束控制器结合,让机器人能够参考示范和交互反馈,在不更新梯度或任务参数的情况下适应新任务。研究显示,人类视频示范可以提升任务完成度,而带有动作对齐信息的参考对接触敏感任务更有帮助。

阅读全文