Qwen发布自动驾驶视觉-语言基础模型Qwen-Drive-1.0,基于Qwen3.5-4B实现3D感知与规划统一
Qwen团队推出Qwen-Drive-1.0,在不改动预训练VLM架构的前提下,通过BEV感知头与规划专家实现3D检测、驾驶问答与轨迹预测,在驾驶VQA与运动规划基准上超越同类模型。
AI解读:Qwen团队发布的Qwen-Drive-1.0试图解决一个核心矛盾:通用的视觉-语言模型(VLM)虽然能理解图像和文字,但缺乏自动驾驶所需的精确3D感知(比如判断物体距离、占用空间)和轨迹规划能力。此前这类能力要么依赖专用感知模型,要么需要改动基础模型架构。Qwen-Drive-1.0的做法是在现有的Qwen3.5-4B模型外部增加两个模块:一个BEV(鸟瞰图)感知头负责3D目标检测、语义占用预测和地图分割,另一个规划专家基于流匹配生成未来5秒的自车轨迹,全程不改动预训练架构。对自动驾驶研发者或相关从业者而言,这意味着可以用一个统一模型同时完成感知、问答和规划,而非拼接多个独立系统。此外,训练完全基于公开数据(283万条样本),并统一了轨迹格式,说明其方法可复现,也降低了数据门槛。不过需要留意的是,这是初步探索,作者自己指出文本推理与生成轨迹之间的一致性仍待加强,且多数基准分数来自模型自评或特定评测协议,实际应用效果还需独立验证。普通驾驶者无需立即行动,这项技术离上车还有距离。
Qwen团队提出Qwen-Drive-1.0,称其为“首个在预训练阶段统一3D感知与视觉问答,并进一步扩展到运动规划的自动驾驶视觉-语言基础模型”,且全程保持预训练VLM架构无改动。
架构:Qwen3.5-4B基座与两个外部模块
据官方博客介绍,Qwen-Drive-1.0以原生多模态的Qwen3.5-4B为基座,共享的视觉编码器与VLM处理单视角与多视角驾驶图像、时序图像序列以及通用图像等各类输入,并在不修改预训练架构的前提下增加两个外部模块。
BEV感知头从多视角单帧输入构建BEV表征,联合完成3D目标检测、语义Occupancy预测与BEV地图分割,作为“显式、可检视的3D探针”,其损失也在联合训练中为共享视觉通路提供额外梯度路径。
规划专家是面向VLM表征的扩散Transformer,基于流匹配生成覆盖未来5秒的自车轨迹,文本形式的规划推理可作为可选条件。感知、问答与规划三项能力统一在同一个预训练VLM内。
性能:驾驶VQA与3D空间感知领先,通用能力保持
Qwen团队称,Qwen-Drive-1.0保持了Qwen3.5-4B在通用感知、识别和推理方面的能力,同时在驾驶VQA和3D空间感知上“显著优于同类型模型”。在LingoQA驾驶问答基准上,Qwen-Drive-1.0-SFT得分77.80,高于对比的InternVL3.5-8B-Inst.(46.40)、Qwen3.5-4B(70.40)和Cosmos-Reason2-8B(59.60);在Ego3D空间估计任务上,其RMSE 7.78,低于Qwen3.5-4B的13.17和InternVL3.5-8B-Inst.的23.01。
官方说明称,所有基准均使用同一组高确定性解码参数(temperature=0.01)。LingoQA由Qwen-Plus评审模型打分,而非官方LingoJudge;在官方协议下,Qwen-Drive-1.0-SFT的LingoScore为79.4。
运动规划:开环闭环均有竞争力,依赖公开数据
运动规划评测中,Qwen-Drive-1.0采用“完全基于公开数据”的训练,共283万条样本,并统一了轨迹格式以实现稳定的5秒、10Hz轨迹预测。开环(Open-loop)Waymo开放数据集(WOD-E2E)上,Qwen-Drive-1.0-SFT在val/test上的RFS为8.45/7.91,优于SpanVLA(7.95/7.78)和AutoVLA(--/7.56);其5秒ADE为1.27/2.67(val/test),低于AutoVLA的--/2.96,也不及SpanVLA的2.28/2.66(另一行显示SpanVLA为2.28/2.66,Qwen-Drive-1.0-SFT为1.27/2.67,但val列有差异)。在伪闭环NAVSIM基准上,Qwen-Drive-1.0-RL的PDMS为90.7,高于SFT的88.2和AutoVLA的89.6。
闭环评测中,在AlpaSim基准上,Qwen-Drive-1.0-RL的at-fault score为0.37,优于SFT的0.27但低于Alpamayo-1.5的0.45。作者指出,“文本推理与生成轨迹之间的一致性仍有待加强,这将是后续工作的重点方向”。模型已提供GitHub、Hugging Face和Model Scope链接(来源未披露具体地址)。