DiVeR:让机器人在关键决策点学会挑选动作
导语
视觉-语言-动作(VLA)模型正在成为机器人执行复杂任务的重要技术路线,但继续扩大机器人数据集和模型规模,往往意味着更高的采集与训练成本。一种更经济的思路,是在测试时为同一状态生成多个动作候选,再借助验证器挑选最可能带来任务成功的方案。
微软研究院等团队提出的 DiVeR,关注的不是“生成更多候选”本身,而是验证器应该重点学习哪些状态。论文指出,一条机器人轨迹中的大多数状态并不具备很强的区分度:不同候选动作可能相近,选择哪一个对最终结果影响有限。真正决定任务走向的,通常是少数动作分歧明显的节点。
核心方法
- 用动作差异估计决策关键性:DiVeR 观察多个采样动作在表示空间中的分散程度。分散越明显,说明模型面对的动作选择越不一致,该状态也可能更值得验证。
- 重新加权验证器学习:传统分类式验证器通常依据整条轨迹的成功或失败训练,并近似平等地处理访问过的状态。DiVeR 则利用决策关键性信号,让训练更集中于候选动作差异较大的位置。
- 不增加额外监督负担:该方法不需要为每一步动作单独制作标签,也不需要额外进行环境交互,主要改变验证器学习时的信息利用方式。
- 保持较低推理开销:决策关键性来自已采样动作的表示,论文称其不会显著增加验证器的推理负担。
实验与意义
论文在 LIBERO、RoboCasa 以及 Franka Research 3 真实机器人实验中评估 DiVeR。摘要显示,该方法在不同设置下都能改善验证器引导的动作选择,从而持续提升任务成功率。
DiVeR 的价值在于,它把测试时扩展从“盲目增加候选数量”推进到“更准确地判断候选在哪里真正重要”。对于长时程操作任务,机器人不必让验证器平均关注整条轨迹,而可以把有限的判断能力集中在抓取、避障、接触或动作切换等可能改变后续结果的状态上。当然,动作表示的分散程度只是关键性的代理信号,其可靠性仍取决于候选动作质量以及表示空间与实际任务后果之间的关联。总体而言,DiVeR 提供了一种无需额外机器人数据、便于接入现有 VLA 测试时推理流程的改进方向。
评论
正在确认登录状态……
正在加载评论……