Zetta:让机器人在执行过程中持续反思与进化
导语
机器人要在真实世界中完成任务,难点往往不在于生成一个看似合理的动作,而在于动作执行后环境已经发生变化:物体位置偏移、抓取失败、路径受阻,都会让原本的计划迅速失效。许多具身智能系统仍采用相对“开环”的方式,执行期间沿用预先设定的技能,等整个回合结束后才进行反思。这种机制难以及时处理连续变化的物理状态。
Zetta 的核心思路,是把“反思”从回合结束后的总结,变成执行过程中的控制机制。论文将其描述为一种闭环具身 harness:基础策略保持冻结,系统则在线演化代码形式的运行时批评器和恢复技能,使机器人能够在不重新训练主策略的情况下积累经验。
三层闭环如何协同
Zetta 将学习与控制拆分为三个时间尺度:
- 动作级治理:在更高频率上监测机器人与环境状态,判断当前动作是否仍然合适,并及时介入执行过程。这一层面向物理交互的快速变化,弥补大型智能体模型难以持续以动作频率决策的问题。
- 回合级提案:一次 rollout 结束后,系统分析执行过程,由批评器识别失败模式,并提出相应的恢复技能或改进方案。
- 验证式技能更新:新生成的技能不会直接写入系统,而是经过验证门控。只有表现得到确认的恢复逻辑,才会加入后续执行流程,从而降低错误经验反复扩散的风险。
这种设计把即时控制、经验总结和长期积累分开处理。它既保留了代码化技能的可编辑性,也避免让每一次失败都直接改变基础策略。
基础设施同样重要
Zetta 还配套提出 Z-Infra,用于将智能体逻辑与异构执行资源解耦。对具身系统而言,模型推理、仿真或真实机器人执行往往运行在不同资源上;基础设施层的解耦有助于组织大规模 rollout,并减少执行资源差异对实验流程的影响。
根据论文提供的结果,在当前 rollout 预算下,Zetta 在 LIBERO-Pro 和 RoboCasa 上分别取得 90.8% 与 93.6% 的成功率,并报告了 11.1 倍推理速度提升。实验还显示,随着自探索经验增加,成功率仍有提升;学习到的技能能够进行零样本迁移,系统也出现了论文所称的机器人“顿悟”现象。
意义与局限
Zetta 的价值不只是提高某几个基准的分数,更在于提出了一条不同于“不断扩大基础模型”的扩展路径:冻结主策略,把可持续改进放到运行时治理、恢复技能和验证机制中。对于物理智能而言,这种架构可能更接近真实部署所需的容错方式。
不过,现有材料主要给出了框架机制和基准结果,尚不足以判断其在更广泛真实环境、长期运行安全性以及技能库规模扩大后的稳定性。未来仍需要更多关于失败分布、验证成本和跨机器人泛化的证据。总体而言,Zetta 展示了闭环自进化 harness 在可靠具身执行方向上的潜力。
评论
正在确认登录状态……
正在加载评论……