返回文章列表
机器人与物理 AI

ShieldVLA:让视觉语言动作模型在“还能补救”时优先选择安全

阅读约 3 分钟

导语

视觉语言动作(VLA)模型正在被用于机器人导航、抓取和操作。它们能够把图像、语言指令与动作决策连接起来,但“完成任务”并不等于“以安全方式完成任务”。在机器人进入危险状态后,模型是否还有机会通过调整动作回到安全轨道,是现有安全微调方法较少直接处理的问题。

ShieldVLA 的核心思路,是把安全问题从单纯的代价惩罚,转化为对“可恢复性”的判断。论文提出一种面向 VLA 的安全对齐框架,并借鉴 Hamilton-Jacobi(HJ)可达性分析,直接从视觉观察中学习一个无模型的安全价值函数。这个 critic 不只判断当前状态是否危险,还试图估计状态是否仍处于可以安全恢复的区域。

核心方法

  • 以可行性控制策略优化。 在仍具备安全恢复可能的状态中,ShieldVLA 允许策略继续追求任务奖励;当状态接近或进入难以安全恢复的区域时,优化过程转而优先推动恢复行为。
  • 减少持续的奖励—安全代价拉扯。 传统拉格朗日方法通常把安全约束转化为奖励中的软惩罚。惩罚过弱可能留下违例,惩罚过强则会让机器人过度谨慎。ShieldVLA 试图通过状态门控,把“完成任务”和“脱离危险”区分开来。
  • 用 VLM 规则评分补足安全标注。 视觉环境很难为每个时间步手工标注精确安全代价。该方法引入基于规则的 VLM 安全评分,将语义层面的反馈整理为 critic 可以使用的结构化训练目标,从而减少对人工成本标签的依赖。
  • 兼容多种 VLA 骨干。 素材显示,方法在 OpenVLA-OFT、OmniVLA、SPOC-VLA 等模型上进行测试,并覆盖导航与操作任务。列举的环境包括 Dubins-VL、TurtleBot-Nav、Safety-CHORES 和 Franka-Reach;摘要则称实验总计涉及五项基准。

结果与意义

根据论文摘要,ShieldVLA 在五项导航和操作基准上的累积安全代价平均降低 57%,相较 SafeVLA,任务成功率提升 0.13。这里的价值不只是让机器人少犯错,也在于避免把所有不确定状态都处理成“停止”或“极度保守”。如果安全 critic 能较准确地识别仍可挽回的状态,策略就有机会在风险可控时继续完成任务,在恢复优先时及时改变行为。

这项工作提出了一个值得关注的训练范式:安全对齐不必始终表现为奖励函数中的固定惩罚,也可以表现为对策略优化阶段的条件切换。不过,VLM 评分的校准质量、视觉观测对隐藏状态的覆盖能力,以及从模拟基准走向真实机器人的泛化,仍将决定这类方法的实际可靠性。ShieldVLA 更像是把“安全边界”和“恢复能力”纳入 VLA 训练的一个框架化尝试,而不是对所有机器人风险的最终解决方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
HuRo:把人类视频转成机器人可用的VLA预训练数据
机器人与物理 AI
cctest.ai
机器人与物理 AI

HuRo:把人类视频转成机器人可用的VLA预训练数据

HuRo提出一套“机器人化”流水线,将异构人类操作视频转换为机器人对齐的观测与动作轨迹,并构建包含约63万条机器人化片段的数据集。实验显示,扩大这类数据的预训练规模,能够明显提升真实机器人操作及分布外泛化表现。

阅读全文