返回文章列表
机器人与物理 AI

自动驾驶 VLM 的“未来轨迹泄题”问题:DEFT-RLVR 用选择题重构可验证推理

阅读约 3 分钟

导语

自动驾驶正在快速引入视觉-语言-动作模型(VLA)和视觉语言模型(VLM),希望模型不仅能“看见”道路环境,还能解释为什么要减速、变道或保持车道。为了增强这种可解释推理,很多训练流程会使用链式思维(CoT)监督。但这篇论文指出,一个看似合理的标注习惯可能埋下了风险:教师模型在生成推理过程时,往往已经看到了日志中的真实未来轨迹。

这相当于先知道答案,再倒推理由。模型生成的解释可能并不是从交通灯、车辆位置、行人行为等场景证据推导出来,而是在为既定轨迹寻找合理说法。作者将这种现象称为“轨迹锚定偏差”。在因果关系更复杂的驾驶场景中,这种偏差还可能带来更严重的幻觉。

核心要点

  • 问题不在于 CoT 本身,而在于答案暴露过早。 当真实未来轨迹在决策前提供给教师模型时,推理过程容易变成事后合理化,降低因果忠实度。
  • 直接移除真实轨迹也不完美。 如果让模型开放式生成未来轨迹,任务会同时涉及高层驾驶决策、几何轨迹合成和低层动力学细节,训练与评估都会变得更复杂。
  • AD-MCQ 将规划改成“多选题”。 作者提出 Autonomous-Driving Multiple-Choice Question,让模型在若干明确给出的候选轨迹中选择,而不是从零生成轨迹。
  • DEFT-RLVR 延迟暴露未来轨迹。 未来轨迹不再作为决策前的锚点,而是在模型做出选择后用于验证,从而更适合强化学习中的可验证奖励训练。
  • 推理能力与通用视觉能力兼顾。 论文称实验显示,DEFT-RLVR 能改善自动驾驶推理,同时保持甚至增强一般视觉能力。

意义与影响

这项工作的价值在于,它把自动驾驶 VLM 的训练问题从“让模型说出漂亮解释”推进到“让解释更接近真实决策依据”。对于安全敏感的自动驾驶而言,可解释性不能只是文本包装;如果解释建立在已知结果上,它在事故分析、模型审计和系统验证中的价值都会打折。

AD-MCQ 的设计也很实际。多候选轨迹让任务结果更容易验证,难度还可以通过候选轨迹构造来控制;同时,推理过程仍可在 VLM 内完成,不必强迫模型承担完整的连续轨迹生成。这为未来研究提供了一个更可扩展的评测与训练框架。

当然,选择题形式也意味着候选轨迹质量会影响训练效果:候选集是否覆盖关键驾驶意图、干扰项是否足够有区分度,都会决定模型学到什么。但总体来看,DEFT-RLVR 抓住了自动驾驶推理数据构造中的一个关键盲点:不要让模型先看见未来,再假装自己推理出了未来。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章