让通用智能体直接操控机器人:Agent as Policy 如何工作
导语
机器人要走出实验室,难点不仅是“看懂”任务,还要把理解转化为连续、可靠的动作。传统机器人系统通常需要为具体任务、环境和物体配置专门的数据与策略。来自圣母大学团队的研究提出 Agent as Policy(AGP),尝试让通用型智能体直接承担机器人策略的角色:它观察现实环境,编写可执行程序,调用机器人接口,并根据动作结果继续调整。
核心要点
- 从规划器变成执行者:AGP并非只输出一份高层计划,而是把任务规划和执行都交给智能体。智能体需要将视觉证据转化为程序和运动命令。
- 运行时闭环控制:机器人完成动作后,系统再次读取视觉或物理结果。如果物体位置、姿态或动作效果不符合预期,智能体可以修改程序或调整后续动作。
- 不依赖任务专门训练:研究强调,实验过程中模型权重保持固定,也没有针对每个任务或环境进行专门训练。智能体主要依靠推理、编程能力以及机器人接口完成适配。
- 覆盖多样操作类型:评测包括从人类视频中复现装配、依据目标图像搭建积木、重新定向骰子、定向投掷,以及双臂折叠毛巾,涉及精细操作、动态运动和可变形物体。
- 程序可以复用:在重复试验中,保存此前生成的程序和操作流程能够减少执行时间,说明运行时生成的策略具有一定的复用价值。
实验结果与边界
摘要显示,在三个积木构型上,AGP的成功率分别为100%、100%和80%。补充材料还指出,在装配、积木构建和骰子翻转的各个评测配置中,系统均至少完成了10次试验中的8次成功。这些结果说明,通用智能体能够在一定范围内把语言与视觉推理转化为实体操作,但它们并不等同于在开放环境中已经具备稳定的通用机器人能力。素材没有提供完整的任务规模、硬件配置、失败类型或与专用策略的系统对比,因此仍需更多实验验证其鲁棒性和泛化范围。
意义与影响
AGP的重要变化,是把“策略”从固定参数模型扩展为一个可以在运行时观察、写代码、调用工具并自我修正的智能体过程。这样的设计可能降低为每个新任务单独训练机器人策略的成本,也让人类示范、目标图像和自然语言任务描述更容易成为统一入口。
不过,代码生成错误、视觉误判、接触动力学不确定性以及安全约束,都会直接影响实体执行。未来要让这类系统走向更复杂的家庭或工业环境,还需要更严格的安全机制、更长时间的连续运行评测,以及对失败恢复和动作可验证性的深入研究。
评论
正在确认登录状态……
正在加载评论……