返回文章列表
机器人与物理 AI

GPT-Policy:让机器人在部署现场从上下文中学习

阅读约 3 分钟

导语

机器人要像人一样适应陌生环境,难点并不只是看懂场景或生成动作,而是能否在任务开始后利用有限示范和交互反馈快速调整策略。传统机器人策略通常依赖预先收集的大规模数据与训练过程,但现实中的任务组合、物体状态和环境变化几乎不可能被有限数据完全覆盖。论文《In-Context Robot Learning with VLM Agents》提出 GPT-Policy,探索让机器人直接借助视觉语言模型的上下文学习能力完成适应。

核心方法

GPT-Policy 由三个关键部分组成:

  • 上下文编译器:从示范和交互过程中提取并保留与任务有关的视觉状态转变,避免将完整但冗余的原始信息直接交给模型。
  • 视觉语言模型代理:根据当前观察、历史上下文和任务信息,提出机器人与工具的操作建议,将视觉理解转化为行动计划。
  • 受约束控制器:检查动作是否满足执行约束,随后控制机器人完成动作,并把执行结果反馈给模型,形成逐步修正的闭环。

这一设计的重点,不是让 VLM 直接承担全部底层控制,而是把高层推理与低层安全执行拆开。模型负责利用示范理解“接下来应该做什么”,控制器则负责判断“这个动作能否被机器人可靠执行”。整个过程不依赖梯度更新,也不要求为每个新任务持续修改专用参数,因此更接近部署阶段的即时学习。

实验观察

研究从任务成功率、执行效率、不同模型的对照以及上下文消融等角度评估系统。在真实机器人实验中,人类视频示范即使不包含机器人动作标签,也能改善任务完成情况。这说明示范中的物体状态变化、动作顺序和结果信息,可能已经足以为模型提供一定的任务线索。不过,当任务涉及抓取、接触或精细操作时,仅仅观察人类动作与机器人执行之间仍存在差距。与机器人动作对齐的参考信息能够进一步带来帮助,尤其体现在接触敏感的任务上。

意义与局限

GPT-Policy 的价值在于展示了一条不同于传统端到端策略训练的路线:机器人可以把 VLM 当作具有上下文记忆和推理能力的通用代理,再由控制模块将语言或视觉层面的建议约束为实际动作。这种架构有望降低新任务适配对专门标注数据和重新训练的依赖,也为视频示范、交互反馈与机器人控制之间的连接提供了实验基础。

但这项工作并不意味着机器人已经获得普适的现场学习能力。视觉模型能否正确理解示范、生成的动作是否符合机器人本体限制、控制器能否处理复杂接触,以及多轮反馈是否会累积错误,仍是可靠部署必须面对的问题。上下文压缩也需要在信息完整性与推理效率之间取得平衡。总体而言,GPT-Policy 更像是对“VLM 能否成为机器人策略代理”的系统性探索,而不是已经解决通用机器人学习的最终方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
小型AI模型如何让无人机在断网战场上自主识别目标
机器人与物理 AI
cctest.ai
机器人与物理 AI

小型AI模型如何让无人机在断网战场上自主识别目标

北约支持的Scaleout Systems正在把轻量级视觉模型部署到无人机、前线平板和指挥节点,使系统即使在通信受干扰时也能执行目标识别与任务更新。其参与的ALMA项目已展示无人机自主发现、定位并攻击指定目标的能力。

阅读全文