返回文章列表
强化学习

机器人不能等模型:星尘 SmoothRL 让异步在线强化学习对准真实动作

阅读约 3 分钟

真实机器人没有暂停键。对于采用 action chunk 的视觉-语言-动作模型或世界-动作模型,模型在后台计算下一段动作时,机器人必须继续执行当前动作。若每隔几百毫秒停下来等待推理,连续摆动、加速和释放等动态过程就可能被打断。

这也给在线强化学习带来一个容易被忽视的问题:模型生成的动作,并不等于机器人实际执行的动作。星尘智能基座模型团队发布的 SmoothRL,正是为处理这一错位而设计的在线强化学习框架。

核心要点

  • 按执行状态拆分动作块。 一个 action chunk 会被划分为已提交区域、实际执行区域和被丢弃区域。后续推理可能覆盖尚未执行的动作,因此训练不能把整段动作一视同仁。
  • 只为真实发生的动作记账。 SmoothRL 只让强化学习梯度通过 execution region,避免机器人没有执行过的动作因任务成功而“获奖”,或因失败而“背锅”。
  • 训练阶段就复现异步部署。 模型推理与机器人执行并行进行,rollout 和 replay buffer 记录真实的时间关系,而不是先在理想同步环境中训练、部署时再切换节奏。
  • 采用局部残差修正。 具体实现以针对任务微调的 π0.5 为基础策略,在原始动作空间中用轻量 TD3-style actor-critic 预测 residual correction。

在 S1 机器人测试中,动作频率为 30 Hz,推理请求频率为 5 Hz。基础策略每次产生 32 帧动作,在固定延迟预算下,只有部分动作会进入实际执行,其余可能在执行前被后续动作块替换。

结果显示,动态投掷成功率从 39% 提升到 94%;给笔戴帽从 8% 提升到 83%;快递开箱从 30% 提升到 90%。这些任务分别考验连续加速与精确释放、毫米级双臂对齐,以及窄缝插入和沿线切割。开箱任务的学习曲线并非持续上升,成功率曾在训练中下降后再回升,说明真实在线探索具有明显波动。

意义与边界

SmoothRL 的价值不在于从零教会机器人完成任务,而在于让已经具备基本能力的策略,根据真实执行结果修正系统性偏差。例如投掷中的释放速度、开箱时的左偏,以及戴笔帽时对位置变化适应不足,都可以通过在线反馈逐步收窄。团队还报告称,在线强化学习后,一次自主投掷中的末端加速度均方根下降 52%,急动度下降 47%,动作更加平滑。

不过,这仍不是完全无人参与的自主进化。当前方法使用稀疏成功/失败奖励,操作员必要时可以介入;基础策略被冻结,残差策略的能力也受其覆盖范围限制。如果初始策略距离目标行为过远,局部修正无法替代全面重训。SmoothRL 更像是连接“预训练会做”和“真实环境做稳”的一层部署后训练机制。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章