返回文章列表
机器人与物理 AI

Zetta:让机器人在执行过程中持续反思与进化

阅读约 3 分钟

导语

机器人要在真实世界中完成任务,难点往往不在于生成一个看似合理的动作,而在于动作执行后环境已经发生变化:物体位置偏移、抓取失败、路径受阻,都会让原本的计划迅速失效。许多具身智能系统仍采用相对“开环”的方式,执行期间沿用预先设定的技能,等整个回合结束后才进行反思。这种机制难以及时处理连续变化的物理状态。

Zetta 的核心思路,是把“反思”从回合结束后的总结,变成执行过程中的控制机制。论文将其描述为一种闭环具身 harness:基础策略保持冻结,系统则在线演化代码形式的运行时批评器和恢复技能,使机器人能够在不重新训练主策略的情况下积累经验。

三层闭环如何协同

Zetta 将学习与控制拆分为三个时间尺度:

  • 动作级治理:在更高频率上监测机器人与环境状态,判断当前动作是否仍然合适,并及时介入执行过程。这一层面向物理交互的快速变化,弥补大型智能体模型难以持续以动作频率决策的问题。
  • 回合级提案:一次 rollout 结束后,系统分析执行过程,由批评器识别失败模式,并提出相应的恢复技能或改进方案。
  • 验证式技能更新:新生成的技能不会直接写入系统,而是经过验证门控。只有表现得到确认的恢复逻辑,才会加入后续执行流程,从而降低错误经验反复扩散的风险。

这种设计把即时控制、经验总结和长期积累分开处理。它既保留了代码化技能的可编辑性,也避免让每一次失败都直接改变基础策略。

基础设施同样重要

Zetta 还配套提出 Z-Infra,用于将智能体逻辑与异构执行资源解耦。对具身系统而言,模型推理、仿真或真实机器人执行往往运行在不同资源上;基础设施层的解耦有助于组织大规模 rollout,并减少执行资源差异对实验流程的影响。

根据论文提供的结果,在当前 rollout 预算下,Zetta 在 LIBERO-Pro 和 RoboCasa 上分别取得 90.8% 与 93.6% 的成功率,并报告了 11.1 倍推理速度提升。实验还显示,随着自探索经验增加,成功率仍有提升;学习到的技能能够进行零样本迁移,系统也出现了论文所称的机器人“顿悟”现象。

意义与局限

Zetta 的价值不只是提高某几个基准的分数,更在于提出了一条不同于“不断扩大基础模型”的扩展路径:冻结主策略,把可持续改进放到运行时治理、恢复技能和验证机制中。对于物理智能而言,这种架构可能更接近真实部署所需的容错方式。

不过,现有材料主要给出了框架机制和基准结果,尚不足以判断其在更广泛真实环境、长期运行安全性以及技能库规模扩大后的稳定性。未来仍需要更多关于失败分布、验证成本和跨机器人泛化的证据。总体而言,Zetta 展示了闭环自进化 harness 在可靠具身执行方向上的潜力。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
少看图、少调用,机器人反而更会做事:PyRUA-Lean如何让GPT-6 Astra提效
机器人与物理 AI
cctest.ai
机器人与物理 AI

少看图、少调用,机器人反而更会做事:PyRUA-Lean如何让GPT-6 Astra提效

一项发表于Hugging Face Daily Papers的研究提出PyRUA-Lean,让机器人智能体通过可执行Python单元组合动作、局部重试,并只请求必要的视觉与状态反馈。在相同语言模型调用预算下,任务成功率从63.1%提升至71.7%,共同完成任务的输入Token减少65%。

阅读全文