返回文章列表
机器人与物理 AI

CARE:让视觉语言动作策略从失败中学会纠错

阅读约 3 分钟

导语

视觉语言动作(VLA)策略正在推动机器人从“看懂指令”走向“直接行动”。但在真实操作中,机械臂很容易因抓取位置偏移、物体姿态变化或阶段衔接不理想而偏离预定轨迹。传统策略往往默认执行过程接近训练数据,一旦出现局部失败,就可能继续错误动作,甚至导致整项任务中断。

来自论文《CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies》的方法,试图把问题转化为一个更具体的能力:机器人如何识别当前处于哪个执行阶段,并用尽可能小的动作把任务拉回正轨。

核心方法

  • 从执行失败中收集经验:CARE不主要依赖人工预设的扰动,也不通过随机改变初始状态来制造纠正数据,而是记录机器人实际执行时产生的失败轨迹。
  • 建立阶段条件化的偏差模型:同一种偏差发生在抓取、移动或放置等不同阶段,后果和最佳恢复方式可能并不相同。CARE据此建模失败后的状态偏差,并利用经验分布合成具有代表性的失败状态和纠正示范。
  • 执行原子级恢复动作:推理时,系统将任务拆分为多个阶段,结合阶段规划判断是否需要局部调整或重新执行某个操作,而不是简单从头开始。
  • 引入物理约束下的三维监测:三维监测用于跟踪场景和执行状态,帮助系统在任务进度仍可保留时触发纠正,从而减少不必要的全流程重启。

如何评估恢复能力

论文提出Failure State Recovery Benchmark(FSR-Bench),重点考察机器人从中间失败状态恢复的能力,覆盖局部偏差和结构异常等情况。这个设计补充了传统“任务成功率”评价:一个策略不仅要能完成顺利执行,也要能在已经出错后继续工作。

根据论文摘要,CARE在多种VLA骨干、仿真基准和真实双臂任务上进行了验证。结果显示,相比对应基线,仿真任务成功率平均提升14.5个百分点,真实世界任务成功率平均提升15.9个百分点。素材未进一步说明不同环境、骨干或任务的具体拆分,因此这些数字更适合作为整体效果概览,而非对所有场景的统一保证。

意义与局限

CARE的价值在于将“失败恢复”从临时补丁变成数据闭环:失败不再只是一次任务损失,也可以成为下一轮纠正策略的训练素材。对长流程机器人任务而言,这种原子化恢复思路有望降低局部错误对全局任务的连锁影响。

不过,方法效果仍取决于失败轨迹的质量、阶段划分以及三维状态监测的可靠性。未来还需要观察它面对更开放环境、更多类型物体和持续变化场景时的泛化能力。论文已公开代码、模型与数据,为复现实验和进一步研究提供了基础。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
HuRo:把人类视频转成机器人可用的VLA预训练数据
机器人与物理 AI
cctest.ai
机器人与物理 AI

HuRo:把人类视频转成机器人可用的VLA预训练数据

HuRo提出一套“机器人化”流水线,将异构人类操作视频转换为机器人对齐的观测与动作轨迹,并构建包含约63万条机器人化片段的数据集。实验显示,扩大这类数据的预训练规模,能够明显提升真实机器人操作及分布外泛化表现。

阅读全文
CCTest · Blog
Grounded Action Model:让机器人先理解物体位置,再决定如何行动
机器人与物理 AI
cctest.ai
机器人与物理 AI

Grounded Action Model:让机器人先理解物体位置,再决定如何行动

Grounded Action Model(GAM)将3D目标定位直接纳入机器人基础模型,使机器人能够根据语言、点或框提示锁定目标,并结合精确几何信息生成动作。实验显示,这种以对象为中心的设计在场景变化、目标移动和长程操作中具备更强的泛化能力。

阅读全文