DriveZero:让自动驾驶学习超越人类示范
导语
多数端到端自动驾驶系统仍主要依赖人类驾驶日志进行模仿学习。这种方法相对直接,但模型能学到的行为通常受限于日志质量:人类没有遇到过的场景、没有采取过的路线选择,以及数据中覆盖不足的驾驶意图,都很难被系统主动学会。小米自动驾驶团队提出的 DriveZero,试图从训练机制上突破这一限制,让自动驾驶模型不再只复现人类示范。
核心思路:把“看”与“做”分开训练
DriveZero 将驾驶拆成感知模型和动作模型两个部分。研究团队认为,感知需要大量、多样的视觉数据来建立对环境的理解,而动作学习则必须在闭环交互中接受反馈。两者如果直接用同一种数据和训练方式处理,往往难以同时达到理想效果。
- DriveRL:面向行动的闭环强化学习。 DriveRL 将真实的 nuPlan 驾驶日志转换为可交互的混合智能体世界。一个场景中可以同时存在日志回放、规则控制和学习策略等不同类型的背景车辆,从而避免单纯回放轨迹带来的环境僵化。研究者在此基础上使用 PPO 训练一个拥有特权信息的教师策略,并让策略通过闭环滚动不断根据环境反馈调整行为。
- DriveVFM:面向感知的视觉骨干。 DriveVFM 将 DINOv3、SigLIP2、SAM 和 Depth Anything V2 等冻结视觉基础模型的能力整合到单一骨干网络中。它只从原始图像学习,不需要额外的任务级标注,目标是获得更通用的场景、目标、语义和深度表征。
- DriveZero:通过蒸馏完成统一。 最终的摄像头端到端规划器使用 DriveVFM 编码多视角图像,并预测轨迹候选。训练监督不再主要来自人类动作,而是来自 DriveRL 教师在交互环境中的滚动轨迹。由于教师具有目标条件,研究者还可以输入增强后的驾驶意图,生成人类日志未覆盖、但与目标一致的行为示范。
实验表现与边界
在 nuPlan 的评测中,DriveRL 配合价值引导的测试时动作搜索,在 Val14、Test14-hard 和 Test14-random 等社区划分的非反应式与反应式设置中,平均得分达到 93.57,并超过日志回放专家。DriveZero 仅使用 DriveRL 生成的轨迹进行训练,在 NAVSIMv1、NAVSIMv2 以及闭环 HUGSIM 基准上取得论文所称的领先表现。
这些结果说明,闭环强化学习可能成为人类驾驶数据的重要补充,而不只是传统模仿学习的附属模块。不过,特权教师与真实车辆之间仍存在信息差,混合智能体环境能否充分代表现实交通也需要更多验证;基准测试中的优势,也不等同于已经解决长尾安全问题。
意义与影响
DriveZero 的价值不只是引入一个新的自动驾驶模型,而是提出了一种更清晰的训练分工:用大规模视觉预训练提升“理解世界”的能力,用闭环强化学习提升“与世界互动”的能力,再通过蒸馏将两者压缩到可部署的端到端规划器中。如果这条路线能够在更广泛的真实道路条件下保持稳定,它可能降低系统对高质量人工示范的依赖,并为主动生成驾驶数据、探索新驾驶意图提供可扩展框架。
评论
正在确认登录状态……
正在加载评论……