返回文章列表
推理与部署

CARE:给视觉语言动作模型加速装上一道“安全闸门”

阅读约 3 分钟

导语

视觉语言动作(VLA)模型正在成为机器人理解环境并执行操作的重要技术路线,但高频控制也带来了显著的推理成本。动作分块、视觉 token 剪枝和减少生成步数等方法可以降低延迟,却可能舍弃对当前任务至关重要的信息。仅比较平均成功率或平均延迟,往往看不出这种风险:策略也许在大多数任务上表现正常,却在少数原本能够完成的任务上失效。

CARE(Certifying Acceleration for Vision-Language-Action Inference)关注的正是这一问题。它不是简单寻找“最快的模型”,而是先验证某个加速方案是否在用户设定的风险预算内,再从合格方案中选择速度最快者。

核心方法

  • 把加速诱发失败单独定义出来。 CARE 关注的不是加速策略总体失败多少次,而是参考策略能够成功、加速策略却失败的情形。这一指标更直接地衡量加速造成的损失。
  • 使用成对闭环 rollout。 对同一初始条件分别运行参考策略和候选加速策略,再根据完整 episode 的终止结果进行比较。这样可以捕捉动作偏差在连续控制中的累积效应。
  • 提供有限样本保证。 CARE 在校准集上进行统计检验,判断加速诱发失败风险是否低于用户指定的预算,并给出置信水平意义上的保障。若没有候选方案达标,系统回退到参考策略。
  • 降低认证成本。 序贯检验会在结果已经足以判定时提前停止;当加速策略失败时,再触发参考策略 rollout,避免对所有候选进行完全穷举。

实验结果与意义

在 OpenVLA-OFT 和四个 LIBERO 套件上,CARE 认证了约 9.0 至 10.8 倍的加速,同时在 95% 置信水平下保证至少 85.8% 的参考策略成功 episode 得以保留。素材还显示,在严格风险预算下,没有保障的选择器在部分试验中可能超出预算,而 CARE 能维持预算约束;其序贯版本相比穷举评估减少了大量 rollout。方法也被扩展到 pi0.5 的 flow-step reduction,以及 Crafter 中的 Qwen3.5-9B 和 Llama-3.1-8B 智能体。

这项工作的价值在于改变了 VLA 加速的评价逻辑:速度不再是孤立指标,而应与“不能破坏原策略能力”的可验证约束绑定。对于机器人部署而言,这种机制尤其适合需要稳定性、可追责性和明确风险边界的场景。当然,保证的有效性仍依赖校准数据、初始状态分布和终止判定是否能够代表实际任务。CARE 因而更像一层部署前的统计安全闸门,而不是对所有环境都成立的绝对正确性证明。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章