Command Palette
Search for a command to run...
Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索
Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索
摘要
我们提出 Qwen-Drive-1.0,作为迈向自动驾驶视觉语言基础模型的初步探索。Qwen-Drive-1.0 保留了预训练视觉语言模型(VLM)的架构,并在统一框架内融合了三维感知、视觉问答与运动规划。一个外部的鸟瞰视角(BEV)感知头联合执行三维目标检测、语义占用预测和 BEV 地图分割。该感知头作为从共享表示中获取三维信息的探针,并提供了对三维场景结构的显式、可检查的接口。一个规划专家模块以共享的 VLM 表示为条件,生成未来的自车轨迹。分阶段训练策略将驾驶监督与通用视觉语言数据相结合,以获取驾驶特定能力,同时有助于保持广泛的视觉理解与指令遵循能力。实验表明,模型具备强大的三维感知与驾驶场景理解能力,同时基本保留了通用视觉语言能力。在开环、伪闭环和闭环设置下的全面评估进一步显示出极具竞争力的运动规划性能。
一句话总结
通义千问团队与华中科技大学提出 Qwen-Drive-1.0,一个面向自动驾驶的视觉-语言基础模型,通过扩展预训练 VLM,增加鸟瞰视角(BEV)头以实现联合 3D 目标检测、语义占用预测和地图分割,引入 Planning Expert 进行轨迹生成,并采用分阶段训练策略将驾驶监督与通用视觉-语言数据相结合,从而在开环、伪闭环和闭环评估中取得强大的 3D 感知能力和有竞争力的运动规划表现,同时基本保留通用视觉-语言能力。
核心贡献
- Qwen-Drive-1.0 是一个面向自动驾驶的视觉-语言基础模型,在不改变预训练 VLM 架构的前提下,将 3D 感知、驾驶视觉问答和运动规划集成在一起。
- 外部 BEV 感知头联合学习 3D 目标检测、语义占用预测和 BEV 地图分割,作为一个显式且可检查的 3D 探针,将感知输出添加到共享 VLM 中,同时保留其通用视觉-语言能力。
- 带有统一数据管线的分阶段训练策略统一了跨数据集标签,为保持一致性重写了 VQA 回答,过滤了样本,并将驾驶监督与通用视觉-语言数据相结合,从而实现领域适应并缓解灾难性遗忘。
引言
作者致力于解决为自动驾驶构建统一视觉-语言-动作模型的挑战,其中预训练的视觉-语言模型(VLM)可以利用广泛的世界知识,在罕见或分布外场景中进行推理。此前的方法通常通过特定于驾驶的视觉问答来适配 VLM,但这种仅文本的监督无法强制执行显式的 3D 空间理解,并且常常导致对通用预训练知识的灾难性遗忘,而这些知识对于在单一计算平台上进行开放世界推理和座舱-驾驶集成至关重要。为了克服这些限制,作者提出了 Qwen-Drive-1.0,这是一个基础模型,首次在不修改原生 VLM 架构的情况下,集成了显式 3D 感知、驾驶场景问答和运动规划。通过附加一个鸟瞰视角感知头作为 3D 探针和一个专用的 Planning Expert,并采用分阶段训练策略将特定于驾驶的数据和通用视觉-语言数据混合,该模型获得了鲁棒的场景理解和轨迹生成能力,同时保留了其原有的通用能力。
数据集
作者将训练数据分为三组:感知、视觉-语言和规划。每组在混合来源之前统一了异构的任务定义,它们共同驱动了一个多阶段的训练策略。
感知数据
- 来源与规模 nuScenes(官方划分):28,000 个带标注的关键帧用于训练,6,000 个用于验证;六个环视相机;语义占用标签来自 nuScenes-OccNet。 OpenScene:607,000 个训练帧和 9,000 个验证帧;八个相机;通过从 trainval 池中保留 16 个日志来平衡城市和时间段,从而创建划分。
- 标签统一
- 3D 检测采用七个 OpenScene 类别(vehicle、bicycle、generic_object、pedestrian、traffic_cone、barrier、czone_sign)。nuScenes 类别被合并:car/truck/trailer/bus/construction vehicle → vehicle;bicycle/motorcycle → bicycle;debris、pushable/pullable objects、bicycle racks、animals → generic_object;pedestrian、traffic_cone、barrier 直接映射;czone_sign 仅从 OpenScene 进行监督。
- 语义占用使用共享的十类空间(七个检测类别加上 driveable、background、empty)。nuScenes 将可行驶表面映射为 driveable,自由空间映射为 empty,其他表面/人造物/植被映射为 background。OpenScene 将前景类别直接映射,背景表面和保留标签映射为 background,unknown/free 映射为 empty。
- 离线补全增补了缺失的类别:OpenScene 缺少可行驶占用;作者栅格化 nuPlan 矢量地图,并重新标记先前为 background 的可行驶区域内地面体素。nuScenes 缺少 generic_object 占用;从自行车架、碎片和可推/可拉物体的 3D 框生成伪标签,仅更新已包含语义标签的体素。
- BEV 地图标签使用六类模式(driveable surface、road line、road edge、crosswalk、walkway、background)在线栅格化,而不是重新映射现有的栅格标注。
- 空间统一 两个数据集都存储 200x200x16 的体素网格,但物理范围、体素大小和 LiDAR 到自车的变换不同(nuScenes:水平 ±40 m,z∈[-1.0,5.4] m,0.4 m 体素,~1.84 m 垂直偏移;OpenScene:±50 m,z∈[-4.0,4.0] m,0.5 m 体素,恒等变换)。为避免错位和类别重采样,保留了原生占用网格。在占用预测期间,一个可微的三线性采样操作将提升的特征体映射到每个数据集的网格上。对于 nuScenes,目标体素中心在自车坐标系中定义,并变换回 LiDAR 坐标系;扩展的垂直范围 [-5.0,5.4] m 覆盖了偏移。对于 OpenScene,恒等变换不需要坐标系转换。BEV 地图监督使用以自车为中心的局部切片,以 0.15 m 分辨率(400x200 目标)栅格化。
视觉-语言数据
- 开源驾驶数据 聚合了 24 个公开数据集(包括 CODA-LM、DRAMA、DriveLM、NuInstruct、OmniDrive 等)。仅使用训练集划分。 预处理:Qwen3.5-Plus 将提示和回答重写为通用的对话模式;边界框归一化到 [0,1000) 坐标;插入视图和帧标签;修改文本视图引用;大多数选择题变为开放式问题。 一致性过滤:Qwen3.5-Flash 检查与源标注的语义一致性。这将样本集从 5.53M 减少到 3.09M(保留率 55.9%)。保留的数据涵盖多视图(61.6%)、单视图(20.1%)、单视图时序(10.1%)、多视图时序(4.4%)和视频(3.7%)样本,覆盖描述、问答、定位、空间推理和规划推理。
- 自建驾驶数据
- 规划推理:在 NAVSIM、Waymo 和 PAI-AV 上构建因果链(Chain-of-Causation)轨迹。基于规则的分类器从未来自车轨迹生成运动先验;Qwen3.7-Plus 以多视图图像、历史轨迹、运动先验和导航指令为条件生成推理轨迹。多阶段审核(判断分类 + 程序化聚合)过滤轨迹,检查动作准确性、因果角色归因和未来信息泄露。罕见场景获得更高的采样优先级。保存两种回答格式:仅轨迹,以及轨迹 + JSON 未来轨迹。
- 相机排序:环视图像被随机打乱并移除视图标签;模型必须识别前视图并恢复顺时针顺序。
- 内部感知 QA:来自中国道路场景的 30K 示例提供交通信号灯定位和 3D 目标检测监督(全局坐标系中的 3D 框,文本中的相机位姿)。
- 阶段 2 混合 过滤后的公开驾驶数据超出预算,因此从每个公开来源中按任务和问题类型分层抽样约 20%。此子集与自建驾驶数据和通用视觉-语言数据混合,在重复前产生 1.54M 示例。各部分比例为 9.7% 3D 感知监督、26.0% 通用视觉-语言和 64.3% 驾驶视觉-语言。特定于组的重复因子赋予感知示例更大的因子(以更新 BEV 头),而视觉-语言示例重复两到三个 epoch。重复后的有效混合为 12.7% 感知、31.0% 通用 VL 和 56.3% 驾驶 VL。
规划数据
- 来源与规模(阶段 3)
NAVSIM、OpenScene(均源自 nuPlan 但自车运动分布不同)、WOD-E2E 和 PAI-AV 共同构成约 2.83M 样本的训练集。
- NAVSIM + OpenScene:来自 2.5K 片段的 890K 样本。
- WOD-E2E:来自 2K 片段的 557K 样本。
- PAI-AV:来自 156K 片段的 1.38M 样本(每个片段仅保留少量均匀间隔的帧)。 在这些样本中,685K(24.2%)携带一个被接受的规划推理轨迹作为条件;其余 75.8% 省略它。
- 预处理 每个未来轨迹都在当前自车坐标系中表示,并转换为 50 个航点表示(10 Hz 的位置和航向)。对于 NAVSIM/OpenScene,数据直接从 nuPlan 数据库读取。对于 PAI-AV,从每个片段的标注中恢复未来自车运动并重新采样。对于 WOD-E2E(提供 4 Hz 位置),将自然三次样条拟合到位置序列并以 10 Hz 评估;导出速度和加速度,航向率对于速度 ≥0.3 m/s 计算为 (v_x a_y - v_y a_x)/||v||^2,否则为零,并积分以获得未来航向。仅当历史和未来加速度幅值保持在 9.8 m/s^2 以内,且航向率通过基于导数和相邻步长的检查(阈值为 1.2 rad/s)时,才保留样本。 输入组成:每个示例包括四个时间步(当前和三个历史,间隔 0.5 s)的前视图、左前视图和右前视图图像。历史图像调整为 320p,当前图像调整为 720p,提供两个视觉 token 预算,同时保留当前观测中的空间细节。这些与历史自车轨迹、当前自车状态、导航指令和可选的规划推理轨迹一起,构成规划预测的条件。
方法
作者为 Qwen-Drive-1.0 利用了一个统一架构,该架构集成了共享视觉编码器和视觉-语言模型(VLM)来处理多样化的驾驶输入。
视觉编码器将图像转换为视觉 token,VLM 将其与文本提示一起编码,以自回归方式生成回答。为处理多视图和多帧输入而不使用显式的结构标识符,作者引入了视图标签和帧标签。视图标签表示八个规范方向,而帧标签将图像与特定时间步关联起来。输入序列化因任务而异:问答示例使用帧优先顺序,而规划示例使用视图优先顺序,以暴露每个视图内的时间变化。VLM 使用标准的下一 token 预测目标进行训练。
两个外部模块利用来自此共享路径的特征来执行几何和轨迹预测,而不改变核心 VLM 架构。
BEV 感知头构建一个共享的自车坐标系鸟瞰视角(BEV)表示,用于 3D 目标检测、语义占用预测和 BEV 地图分割。它融合了两个互补的特征流:来自视觉编码器的低级外观特征和来自 VLM 输出的更广泛的场景上下文特征。基于深度的视图变换使用轻量级深度网络将单尺度视觉编码器特征提升到 3D 体,该网络预测每像素的分类深度分布。然后,基于查询的 BEV transformer 将多尺度 VLM 特征聚合到 BEV 平面上,并使用高度压缩的 3D 体进行初始化以提供几何先验。特定于任务的解码器,包括用于检测的 DETR 风格解码器和用于占用和地图分割的 UNet 风格头,在此集成的 BEV 特征上运行。
Planning Expert 预测未来自车运动,将其形式化为条件生成。它采用一个 32 层的扩散 transformer,以来自 VLM 的分组查询 softmax 注意力层的缓存键和值为条件处理含噪轨迹 token。共享的自适应层归一化注入流时间、导航指令和当前自车状态。作者使用带有 x-prediction 参数化的流匹配来训练此模块,直接估计干净的轨迹端点以降低对传感器噪声的敏感性。目标函数结合了流匹配损失和时间正则化器,以抑制航点抖动和加速度突变。
作者实施了一个四阶段训练策略,以逐步适配模型组件。
在阶段 1,作者预训练 BEV 感知头,同时保持视觉编码器和 VLM 固定。这初始化了视图变换、BEV transformer 和任务解码器,以构建自车坐标系表示。
阶段 2 涉及感知头、视觉编码器和 VLM 的联合训练。由于仅头部训练性能有限,此阶段使用感知和视觉-语言样本的混合,针对显式 3D 预测优化整个共享路径。BEV 感知头使用的学习率比 VLM 高 20 倍,以便快速适应。
在阶段 3,作者预训练 Planning Expert,同时冻结视觉编码器和 VLM。训练混合包括带有和不带有文本规划推理的样本,仅通过流匹配目标监督未来轨迹。这将轨迹学习与视觉-语言表示的变化分离开来。
阶段 4 通过强化学习精炼 Planning Expert。由于轨迹回归没有显式捕捉碰撞避免或人类偏好,作者使用任务级奖励优化该模块。为了在确定性流上启用策略梯度优化,他们在平滑的低频时间子空间内,在最后三个积分步骤上引入随机转移。这种方法生成连贯的轨迹变化,同时限制与预训练流的偏差。作者计算多次 rollout 的组相对优势,并使用折扣策略梯度目标优化 Planning Expert。
实验
Qwen-Drive-1.0 集成了 3D 感知、驾驶视觉理解和运动规划,同时保留了广泛的通用视觉-语言能力。使用 BEV 感知头进行联合适配,取得了领先的检测和地图分割结果,并保持了推理能力,而因果链监督则显著提升了因果场景理解。运动规划中的强化学习增强了偏好对齐,减少了闭环中的驶离道路事件,尽管在前向进度上有所折衷,并且规划能力随着更多训练数据而持续提升。感知通路还展示了对未见过的相机装置进行合理的定性迁移,显示了无需特定于数据集的适配即可运行的 3D 感知能力。
跨数据集标签统一将不同的感知标注对齐到共享的特定于任务的分类法中。合并和补全策略将 3D 检测的类别数减少到 7,语义占用减少到 10,BEV 地图分割减少到 6。来自源数据集的五个车辆类别被合并为 3D 检测中的单个类别。bicycle 和 motorcycle 在 3D 检测分类法中被合并为一个统一类别。仅来自 OpenScene 的 czone_sign 类别保留在最终的 3D 检测标签集中。语义占用处理使用特定于数据集的查找表,并从 3D 框补全 generic_object,从地图数据补全 driveable。BEV 地图分割在共享的 6 类模式下,对两个数据集的矢量地图进行在线栅格化。
在统一的 nuScenes 基准测试上,Qwen-Drive-1.0-SFT 在比较方法中取得了最强的检测和地图分割结果。用视觉-语言预训练的 ViT 骨干网络替换 ResNet-50 持续改进了检测,但在这些相同特征上训练的感知头在 3D 检测和占用方面仍不及多任务 ResNet-50 基线,这表明视觉-文本对齐并未直接提供驾驶感知所需的 3D 结构。视觉-语言预训练骨干网络(SigLIP-Qwen)显著提升了检测:BEVFormerV2 在 nuScenes 上的 mAP 从使用 ResNet-50 时的 33.04 上升到使用 ViT 时的 40.78。Qwen-Drive-1.0-SFT 在 nuScenes 上以 2.01 mAP 超越多任务 BEVFormerV2*,以 3.37 地图 mIoU 超越 PETRv2,并且在 OpenScene 的检测和地图分割上也优于仅头部联合模型。
Qwen3.5-4B 在六个越高越好的驾驶 VQA 指标上取得了最高平均值,优于更大的模型。Gemma4-12B 在 Waymo 安全问题和内部驾驶决策基准上领先,而 Cosmos-Reason1-7B 尽管总体 VQA 平均值最低,但在因果链推理中取得了最佳的关键物体准确率,揭示了标准基准并未完全捕捉因果驾驶能力。Qwen3.5-4B 在公开驾驶 VQA 和空间理解基准上取得了最高的综合平均值,在 LingoQA、Ego3D 准确率、VLAD 和 SURDS 上得分最佳。Cosmos-Reason1-7B 在 PAI-AV-Coc 因果推理上获得了最高的关键物体准确率,尽管它在总体 VQA 平均值上排名最后,而 Gemma4-12B 在 Waymo 安全准确率和内部决策基准上表现优异。
一个关于时序理解的定性示例显示,模型对视频序列中停放车辆数量的预测内部不一致,开始时声称零辆,然后是两辆,最后是三辆。这种自相矛盾突显了跨帧维持连贯的 agent 状态估计的困难。模型最初声明没有停放车辆,然后描述道路两侧有两辆停放车辆,最后在最后一帧中数出右侧有三辆。同一场景下不断变化的计数表明稳定的时序状态追踪失败,而这对于可靠的场景理解至关重要。
在驾驶适配之后,Qwen-Drive-1.0-SFT 在第 (a) 组基准上保留了通用知识和推理能力,与 Qwen3.5-4B 的差距在一个点以内,同时在第 (b) 组的空间理解和定位上超越了它。它在 MMStar、RealWorldQA、ERQA 和 ODinW13 上取得了最高分,并在所有设置的平均值上超越 Cosmos-Reason2-32B 超过五个点,展示了保留的广泛能力与增强的空间推理。在知识、推理和识别基准上,Qwen-Drive-1.0-SFT 平均得分为 66.41,保持在 Qwen3.5-4B 的 67.40 的一个点以内。在空间理解和定位基准上,它平均得分为 53.96,超过了 Qwen3.5-4B 的 52.99。它在 10 个第 (a) 组设置中的 6 个上排名第一或第二,包括在 MMStar 和 RealWorldQA 上取得最佳分数。它在 ERQA 和 ODinW13 上取得了最佳分数,涵盖了具身空间推理和开放集物体定位。它在 15 个设置中的 10 个上达到或超越了 Cosmos-Reason2-32B,总体平均值高出 5.48 个点。
评估将多个感知数据集的标签统一到用于 3D 检测、语义占用和 BEV 地图分割的共享分类法中,然后在生成的基准上评估模型。视觉-语言预训练骨干网络显著改进了检测,但在这些特征上训练的多任务感知头在三维理解方面仍然滞后,表明仅靠视觉-文本对齐并不能提供所需的 3D 结构。在驾驶视觉问答方面,标准聚合分数未能反映因果推理能力,定性测试暴露了跨帧不一致的时序状态追踪。在驾驶适配之后,模型保留了通用知识和推理能力,同时在空间定位上超越了其基础版本,并在总体平均性能上超越了更大的模型。