返回文章列表
机器人与物理 AI

让通用智能体直接操控机器人:Agent as Policy 如何工作

阅读约 3 分钟

导语

机器人要走出实验室,难点不仅是“看懂”任务,还要把理解转化为连续、可靠的动作。传统机器人系统通常需要为具体任务、环境和物体配置专门的数据与策略。来自圣母大学团队的研究提出 Agent as Policy(AGP),尝试让通用型智能体直接承担机器人策略的角色:它观察现实环境,编写可执行程序,调用机器人接口,并根据动作结果继续调整。

核心要点

  • 从规划器变成执行者:AGP并非只输出一份高层计划,而是把任务规划和执行都交给智能体。智能体需要将视觉证据转化为程序和运动命令。
  • 运行时闭环控制:机器人完成动作后,系统再次读取视觉或物理结果。如果物体位置、姿态或动作效果不符合预期,智能体可以修改程序或调整后续动作。
  • 不依赖任务专门训练:研究强调,实验过程中模型权重保持固定,也没有针对每个任务或环境进行专门训练。智能体主要依靠推理、编程能力以及机器人接口完成适配。
  • 覆盖多样操作类型:评测包括从人类视频中复现装配、依据目标图像搭建积木、重新定向骰子、定向投掷,以及双臂折叠毛巾,涉及精细操作、动态运动和可变形物体。
  • 程序可以复用:在重复试验中,保存此前生成的程序和操作流程能够减少执行时间,说明运行时生成的策略具有一定的复用价值。

实验结果与边界

摘要显示,在三个积木构型上,AGP的成功率分别为100%、100%和80%。补充材料还指出,在装配、积木构建和骰子翻转的各个评测配置中,系统均至少完成了10次试验中的8次成功。这些结果说明,通用智能体能够在一定范围内把语言与视觉推理转化为实体操作,但它们并不等同于在开放环境中已经具备稳定的通用机器人能力。素材没有提供完整的任务规模、硬件配置、失败类型或与专用策略的系统对比,因此仍需更多实验验证其鲁棒性和泛化范围。

意义与影响

AGP的重要变化,是把“策略”从固定参数模型扩展为一个可以在运行时观察、写代码、调用工具并自我修正的智能体过程。这样的设计可能降低为每个新任务单独训练机器人策略的成本,也让人类示范、目标图像和自然语言任务描述更容易成为统一入口。

不过,代码生成错误、视觉误判、接触动力学不确定性以及安全约束,都会直接影响实体执行。未来要让这类系统走向更复杂的家庭或工业环境,还需要更严格的安全机制、更长时间的连续运行评测,以及对失败恢复和动作可验证性的深入研究。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
让机器人少看“捷径”:LIT如何提升视觉动作模型的泛化能力
机器人与物理 AI
cctest.ai
机器人与物理 AI

让机器人少看“捷径”:LIT如何提升视觉动作模型的泛化能力

机器人基础模型在熟悉环境中表现出色,却可能依赖与动作偶然相关的视觉线索。新提出的 Latent Interface Training(LIT)通过分阶段训练和姿态监督,限制视觉信息进入动作生成的方式,从而提升模型面对相机、光照和干扰变化时的稳定性。

阅读全文