返回文章列表
机器人与物理 AI

Qwen-Drive-1.0:把视觉语言模型推进自动驾驶统一框架

阅读约 3 分钟

自动驾驶模型正在从“分别完成感知、问答和控制”走向更统一的视觉语言框架。论文提出的 Qwen-Drive-1.0,正是这一方向的一次早期尝试:它保留预训练视觉语言模型的主体架构,再把驾驶场景中的三维理解与轨迹规划接入共享表示,而不是完全重建一套只面向驾驶的模型。

这项工作做了什么

Qwen-Drive-1.0的核心并非单一感知模块,而是让多类任务围绕同一套视觉语言表示协同工作:

  • 接入三维场景接口。 模型外挂一个鸟瞰视角(BEV)感知头,同时处理三维目标检测、语义占用预测和BEV地图分割。这个设计既承担感知任务,也可作为“探针”,观察共享表示中究竟包含多少三维场景信息。
  • 引入规划专家。 Planning Expert以视觉语言模型的共享表示为条件,输出未来的自车运动轨迹。相比只生成文字描述,这一步让模型直接连接到驾驶决策所需的连续运动结果。
  • 采用分阶段训练。 训练过程同时使用驾驶监督和通用视觉语言数据,目标是在获得驾驶专长的同时,尽量保留原有的视觉理解、问答和指令跟随能力。

为什么值得关注

自动驾驶场景对模型的要求并不止于识别“看到了什么”。系统还需要理解物体的空间位置、道路结构、可行驶区域以及这些因素对未来运动的影响。Qwen-Drive-1.0通过BEV头提供了一个较明确、可检查的三维结构接口,使共享表示不再只是难以解释的中间特征,而能通过检测、占用和地图任务接受检验。

与此同时,视觉语言模型的通用能力为驾驶系统提供了更丰富的场景理解基础。论文报告称,模型在三维感知和驾驶场景理解方面表现较强,并且总体保留了通用视觉语言能力;在开放环、伪闭环和闭环设置下,运动规划也展现出有竞争力的结果。这里的价值不只是成绩本身,更在于说明通用VLM与驾驶专用模块之间存在一种可行的组合方式。

仍需观察的问题

这项工作被定位为“初步步骤”,因此不应将其理解为已经解决自动驾驶中的全部安全与部署问题。共享表示能否稳定支撑复杂长尾场景、规划输出在真实交通中的鲁棒性,以及闭环表现能否跨数据集和环境保持,仍需要更广泛的验证。总体而言,Qwen-Drive-1.0展示了一条值得继续探索的路线:以通用视觉语言模型为底座,通过可检查的三维接口和专门的规划模块,逐步建立面向自动驾驶的多任务基础模型。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
VLA不只靠堆数据:VLAct把表示学习放在机器人泛化之前
机器人与物理 AI
cctest.ai
机器人与物理 AI

VLA不只靠堆数据:VLAct把表示学习放在机器人泛化之前

机器人数据难以像互联网图文数据那样规模化,VLA模型的瓶颈因此不只是数据量,也在于如何从有限轨迹中学习可迁移的视觉—动作表示。VLAct通过多本体继续预训练,在较低算力与下游数据预算下取得了较强表现。

阅读全文