机器人没按指令行动,VLA如何在部署现场学会自我补偿?
导语:动作预测正确,机器人仍可能失败
视觉语言动作模型(VLA)通常根据图像、语言指令和机器人状态生成动作。但在真实环境中,模型发出的命令并不等于机械臂最终完成的运动:关节摩擦会让动作迟滞,齿轮回差可能造成方向切换误差,负载变化会影响动力学表现,长期使用还会带来磨损和热漂移。对 VLA 而言,这些偏差会不断积累,最终使本来合理的动作序列失效。
来自浦项科技大学的研究提出“自补偿 VLA”,核心思路不是重新训练一个更鲁棒的策略,而是让模型在部署过程中观察自己的指令与机器人实际运动之间的差距,并据此提前修正后续命令。
核心方法:利用执行残差在线适应
- 模型首先生成期望动作,机器人控制器照常执行,不需要更换底层控制系统。
- 系统通过本体感知反馈记录实际运动,并计算“命令动作—执行结果”之间的残差。
- 研究者使用这一残差在线更新 VLA 中的小型 LoRA 适配器,而不是大幅修改整个模型。
- 适应过程不依赖任务奖励、人工标签或额外成功判定,因此更接近真实部署条件。
这种设计的关键在于,误差本身就提供了关于机器人当前状态的信息。模型不必显式建立完整的机器人动力学模型,也能逐步学会在特定机械臂、负载和使用状态下发出更合适的指令。
RoboStress:把难以覆盖的执行误差搬进模拟器
为测试 VLA 在不同执行条件下的稳定性,研究还推出 RoboStress 基准。它在关节层面组合摩擦、回差、柔顺性和重力补偿误差,并构造七种部署场景,使执行误差随机器人状态和运动历史变化。素材提到的场景包括重负载、热漂移和机械磨损等因素。
与只在训练阶段加入随机扰动的方法相比,RoboStress 更强调部署时的动态偏差:同一条指令在不同关节状态、运动方向或历史轨迹下,可能产生不同结果。实验显示,自补偿 VLA 在七种场景中均优于基础策略、域随机化方法和 RobustVLA,并在两种 VLA 主干上都保持这一趋势。
真实机械臂结果与意义
研究团队还在两台使用历史不同的 Piper 机械臂上进行测试。自补偿方法使两台机械臂的平均任务成功率都提升了 30 个百分点以上;在未出现在任务示范中的物体上,π₀.₅ 的成功率从 16% 提升到 64%。这些结果表明,方法适应的不只是某个固定物体或单一演示,而是机器人本身的执行特性。
这项工作的价值在于,它把机器人适配从“训练前尽量覆盖所有硬件差异”转向“部署中根据真实反馈持续校准”。这对存在磨损、负载经常变化或难以频繁重新采集示范数据的机器人尤其重要。不过,在线适配也意味着系统需要谨慎处理反馈噪声、分布变化和异常执行,长期稳定性与安全边界仍是实际落地时需要继续验证的问题。
评论
正在确认登录状态……
正在加载评论……