返回文章列表
强化学习

VLA-Precision:让视觉语言动作模型在真实世界中更稳地试错

阅读约 3 分钟

导语

视觉语言动作模型(VLA)正在成为机器人执行复杂操作的重要技术路线。它们可以理解视觉场景和语言指令,并直接生成动作,但“能完成”与“稳定、精准地完成”之间仍存在明显差距。尤其在化学实验等对位置、力度和重复性要求较高的任务中,单靠示范数据训练出的策略往往难以覆盖真实环境中的误差。

论文提出的 VLA-Precision,试图把真实世界在线强化学习引入 VLA 后训练,同时处理两个实际难题:一是价值模型不可靠时,策略可能朝错误方向更新;二是大规模 VLA 的推理和训练成本较高,会限制机器人收集经验的速度。

核心要点

  • 用非对称协同自举稳定学习过程。 ACoB 将行为学习和价值学习安排在不同阶段、不同时间尺度上。训练初期,系统借助人工干预引导的行为学习快速改善策略,并同步提升后续自主采样经验的质量。
  • 从“先会做”过渡到“知道哪种做法更好”。 随着自主经验增多,方法利用全局回报传播评估完整轨迹,再结合局部动作偏好进行细粒度排序。这两类信号共同校准价值估计,形成相对动作优势。
  • 通过参考策略抑制漂移。 得到的动作优势并非直接推动策略无限偏离,而是用于带参考约束的策略改进,使模型在吸收新经验的同时保留预训练 VLA 的基础能力。
  • 用 ACoB-Stream 提升在线效率。 该架构将经验采集与策略更新置于闭环中,并以不变状态解耦和按需流式处理为设计原则,减少大模型反复加载和等待带来的开销。论文摘要报告其吞吐与计算效率最高可提升 10.9 倍。

意义与影响

VLA-Precision 的价值不只在于提出一个新的强化学习目标,更在于把算法稳定性和系统吞吐放在同一套设计中考虑。对于真实机器人而言,经验采集受到时间、设备和安全成本限制,低效或不稳定的在线更新都可能迅速放大问题。先用干预经验建立较可靠的行为基础,再让自主数据逐步参与价值校准,是一种更贴近现实部署条件的训练路径。

论文在四类高精度化学任务、四种机器人形态上进行评估,说明作者关注的是跨任务、跨 embodiment 的真实操作场景。不过,现有素材中的摘要在最终结果处被截断,未提供完整成功率或各任务的详细对比,因此不宜据此判断其相对现有方法的具体优势。更值得继续关注的是:价值校准在更长时域任务中的稳定性、干预数据需求,以及 10.9 倍效率提升在不同硬件配置下的可复现程度。

总体而言,这项工作为 VLA 在线后训练提供了一个清晰框架:用分阶段学习降低价值误导风险,用参考约束控制策略漂移,再用流式系统架构解决大模型带来的工程瓶颈。若相关机制能在更多机器人平台和非实验室环境中保持效果,VLA 从“泛化操作”走向“可重复的精密操作”将更具现实基础。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章