返回文章列表
机器人与物理 AI

机器人迎来“GPT-3时刻”:看几秒演示就能学新动作

阅读约 3 分钟

导语

机器人要学会一个新动作,通常需要采集数据、训练模型,再反复调参。Generalist公布的GEN-1.5则展示了另一条路径:机器人先看一段3至12秒的动作演示,随后直接尝试完成此前没有专门学过的任务。这个过程不进行梯度更新,也不依赖现场微调,因此被外界形容为机器人领域的“GPT-3时刻”。

核心要点

  • 把动作演示变成物理上下文。 在传统机器人学习中,示范往往会被用于训练或微调模型。GEN-1.5尝试将刚刚观察到的动作直接放入当前推理上下文,让机器人根据示例临时获得执行策略。
  • 能够组合多个示范。 例如,模型先学习用刷子清扫,再面对不同物体时继续完成类似动作;加入簸箕后,它还可能推断出一只手清扫、另一只手承接的配合方式。更复杂的动作衔接、重新定位和失败恢复,并不一定需要逐步演示。
  • 模拟器数据也可以成为提示。 脚本生成的轨迹、强化学习智能体的操作,以及人在模拟器中遥控机器人完成的动作,都能作为Physical Prompt。研究展示了模型先观看模拟环境中的演示,再尝试在真实世界复现的案例。
  • 能力似乎来自规模化预训练。 Generalist称,团队并未专门为一次性学习设计额外架构或目标函数。随着模型持续吸收真实物理交互数据,完成新任务所需的数据量逐步减少,最终显现出不更新参数也能适应新动作的能力。

仍需冷静看待

这并不意味着机器人已经实现稳定的“看一遍就会”。据材料,GEN-1.5在10种任务上仅使用一次Physical Prompt时,平均成功率为59%;如果再提供5分钟数据并进行10步梯度更新,成功率可提升至83%。测试任务主要是短程、相对原子化的操作,临时学到的技能在可靠性上仍落后于专门微调的模型。

因此,真正值得关注的不是单次成功率已经达到什么水平,而是机器人是否开始拥有类似语言模型的“从上下文中临时学习”能力。连续物理数据包含动作顺序、结果反馈、重复操作和失败恢复等信息,长期预训练可能让模型学会先理解刚刚发生的事情,再决定下一步动作。

意义与影响

如果这条路线能够继续扩展,机器人部署方式可能发生变化:工程师不必为每个新任务重新训练模型,用户也可以通过一段示范完成技能传递。所谓“物理版提示工程”,本质上是把文字提示替换成可观察、可执行的动作上下文。

不过,跨场景泛化、长程任务规划、安全性和失败后的可控恢复,仍是从演示到实际应用必须解决的问题。GEN-1.5更像是一个重要信号:机器人基础模型正在从“记住训练过的动作”,迈向“根据刚看到的示例临时组织行为”。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Ego2Robot:把第一人称人类视频变成机器人训练数据的可扩展方案
机器人与物理 AI
cctest.ai
机器人与物理 AI

Ego2Robot:把第一人称人类视频变成机器人训练数据的可扩展方案

这项工作提出了一条把第一人称人类操作视频转换为机器人训练数据的流水线,目标不是做单个任务的演示复刻,而是为具备泛化能力的视觉-语言-动作模型提供大规模预训练数据。研究同时给出了更系统的泛化评测框架。

阅读全文