少看图、少调用,机器人反而更会做事:PyRUA-Lean如何让GPT-6 Astra提效
导语
机器人智能体并不是“看得越多、问得越勤”就越可靠。对于依赖视觉反馈的VLM机器人系统,每执行一个动作,通常都可能触发一次模型调用和一轮图像上传。连续的观察与重复的规划不仅增加Token开销,也会把本可在本地完成的判断交给语言模型处理。
Hugging Face Daily Papers介绍的PyRUA-Lean,尝试从控制流程本身解决这一问题。研究团队让智能体不再只通过一个个工具调用推进任务,而是编写可执行的Python单元,将动作组合、条件检查和局部重试放在同一段程序中完成。
核心方法
- 从工具调用转向代码执行:智能体可以组合经典机器人原语,以及学习得到的视觉语言动作(VLA)策略,形成更完整的操作流程。
- 在本地处理简单反馈:Python单元能够先检查状态,再决定是否继续、重试或返回结果,减少每个微小决策都重新请求LLM的需要。
- 选择性获取观测:执行框架只返回智能体明确请求的图像和状态反馈,避免把每一步都产生的冗余视觉信息送回模型。
- 保持公平对比:实验使用相同的GPT-6 Astra规划器和底层机器人原语,将PyRUA-Lean与工具调用基线进行比较。
实验结果
研究覆盖LIBERO-PRO、RoboTwin 2.0和RoboCasa365中的700个模拟任务实例。在相同的LLM调用预算下,PyRUA-Lean的总体成功率为71.7%,工具调用基线为63.1%,提升了8.6个百分点,约对应标题所称的14%相对提升。
另一个结果更直接地体现了效率变化:在两种智能体都成功完成的任务上,PyRUA-Lean使用的LLM调用减少49%,输入Token减少65%。这意味着它并非单纯依靠更多推理轮次换取成功,而是把一部分控制逻辑下沉到执行环境,让模型集中处理需要重新规划的问题。
意义与局限
这项工作提示,机器人智能体的效率瓶颈不只在模型能力,也在模型与环境之间的交互协议。将“观察—判断—动作”的循环改造成可组合、可条件执行的程序,有望同时降低推理成本和反馈延迟,并为动作原语与VLA策略的混合使用提供更清晰的接口。
不过,现有结果来自三个模拟基准,材料没有给出真实机器人部署、不同模型规模或长时任务中的表现。因此,Token减少能否稳定转化为现实环境中的速度、成本和可靠性优势,仍需要进一步验证。至少从当前实验看,机器人智能体的下一步优化方向,可能不是让模型看更多,而是让它学会在合适的时候少看、少问,并把局部控制交给程序。
评论
正在确认登录状态……
正在加载评论……