Skill2Real:让机器人技能从仿真直接走向现实
机器人从仿真环境走进现实,难点通常不只是“学会动作”,而是让这些动作在视觉、动力学和机械形态发生变化后仍然可用。论文提出的 Skill2Real,试图把仿真到现实问题转化为一种可复用的技能学习与调用问题。
核心方法
Skill2Real以共享的机器人应用程序接口(API)作为技能边界。技能不直接绑定某个仿真器内部状态,而是依赖公开可获得的观测,以及具有明确语义的API操作。这样,技能记忆在迁移到真实机器人时,不必随着环境变化重新修改。
框架采用“提议者—验证器—治理器”(PVG)循环。提议者生成或调整技能,验证器借助仿真中的特权证据分析任务是否成功、定位失败原因,治理器则决定哪些更新值得保留以及如何控制技能记忆的演化。三者共同构成一种带有反馈和筛选机制的训练流程,而不是单纯让模型反复试错。
在能力结构上,系统先由“⼩脑”学习局部操作技能,再由“⼤脑”学习如何按照任务目标组合这些技能;进入第二阶段后,⼩脑保持冻结。最终,局部技能记忆和任务级记忆一起迁移到真实机器人,过程中不进行任务策略微调,也不更新技能记忆。
实验结果
- 使用 GPT-5.6 Sol 在 LIBERO-90 上学习技能,并用 GPT-6 Astra 评估每个冻结检查点后,LIBERO-Pro Long 成功率从 2.0% 提升至 56.3%,训练过程中没有针对 Pro Long 进行训练。
- 在 Robosuite 的七项任务上独立训练时,Sol 和 Opus 5 的平均成功率分别达到 85.1% 和 89.4%。
- 由 Sol 在 LIBERO-90 上训练得到的冻结技能,经 Astra 执行后,在四项真实世界操作任务上的平均完成率为 78.75%。
- 去掉验证器或治理器后,最终 Pro Long 成功率分别下降 17.3 和 13.3 个百分点,说明这两个环节并非装饰性模块。
意义与局限
Skill2Real的关键价值,在于把迁移重点从“重新训练一个任务策略”转向“学习可组合、可检查的执行技能”。统一API为不同机器人和环境之间提供了抽象层,分层记忆则对应从动作执行到任务规划的不同时间尺度。PVG闭环进一步利用仿真中真实世界难以获得的诊断信息,帮助系统筛选更可靠的技能更新。
不过,现有结果仍主要来自论文列出的特定基准、模型组合和四项真实任务。API设计、观测质量以及仿真与真实设备之间的差异,仍可能影响迁移效果。未来是否能扩展到更多机器人形态、更开放的任务和更长的操作链条,还需要进一步验证。总体而言,这项工作展示了一条颇具吸引力的路线:让机器人通过共同接口积累可执行技能,再将技能记忆而非单一任务策略带入现实。
评论
正在确认登录状态……
正在加载评论……