开源IT之家AI资讯·原文 2026年9月6日

阿里千问开源自动驾驶视觉语言模型Qwen-Drive-1.0-4B,提供SFT和RL两个规划专家

该模型基于Qwen3.5-4B构建,据称是首个面向自动驾驶的视觉语言基础模型,官方评测覆盖 3D感知、场景理解与闭环规划等能力。

AI解读:阿里千问开源的Qwen-Drive-1.0-4B试图解决自动驾驶模型既要看懂路况、又要听懂指令、还要能规划行驶轨迹的问题。过去这类能力往往分开训练,而官方称这是首个面向自动驾驶的视觉语言基础模型——在预训练阶段就把 3D感知和视觉问答统一起来,再扩展到运动规划,并且保留原始VLM架构,让模型在学会开车的同时不丢掉通用视觉理解。对车企或自动驾驶研究者来说,价值在于它只用了公开数据构建规划样本,还统一了各数据集的轨迹格式,降低了复现和适配的门槛;模型同时发布SFT和RL两个版本,后者强化了人类偏好对齐和闭环安全性,代价只是微小的开环误差。需要注意的是,这些说法均来自官方,评测是否覆盖真实路测并未在来源中说明,普通用户无需立即行动,但做仿真训练或数据研究的团队可以评估其基准表现是否满足需求。

IT之家 9 月 6 日消息,阿里千问本周开源了Qwen-Drive-1.0-4B,一款基于Qwen3.5-4B构建的自动驾驶视觉语言模型。

官方称首个面向自动驾驶的VLM基础模型

据官方介绍,Qwen-Drive-1.0在预训练阶段统一了 3D感知与视觉问答,并进一步扩展至运动规划,同时完全保留了预训练VLM的原始架构。

模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时保留通用视觉理解与指令遵循能力。

模型版本与评测范围

Qwen-Drive-1.0-4B同时提供SFT和RL两个规划专家。官方评测覆盖 3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

据介绍,模型仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并从开环预测到闭环驾驶进行全面评估。官方称SFT模型在所有基准上已具备竞争力;经过强化学习后,模型仅以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。

  • 模型已发布在GitHub、Hugging Face和ModelScope平台。

信息来源

IT之家AI资讯原始来源