自动驾驶的「大脑」路线又多了一个开源选项。阿里 Qwen 团队联合华中科技大学发布 Qwen-Drive-1.0-4B,被定位为首个把 3D 感知、驾驶场景问答与运动规划统一进同一个视觉语言模型(VLM)的自动驾驶基础模型。它没有把感知和轨迹生成当成两套互不相干的系统,而是试图用一份共享表征,同时支撑场景理解、显式三维结构与未来轨迹生成。

一、一个 VLM,多个驾驶头

Qwen-Drive 的底座是原生多模态的 Qwen3.5-4B,在不改动预训练架构的前提下外挂两个专用模块:BEV 感知头作为可检视的三维探针,联合完成 3D 目标检测、语义占据预测与 BEV 地图分割;Planning Expert 是一个约 1B 参数的扩散 Transformer,通过流匹配生成 5 秒、10Hz 的未来自车轨迹。规划既支持直接出轨迹,也可先给一段文字推理作为条件。整个系统以 Apache 2.0 协议开源,权重、代码与演示数据均公开。

二、成绩与边界

在公开基准上,SFT 版驾驶场景问答均分达到 69.43,超过若干更大规模的通用与专项模型;运动规划在 NAVSIM 上取得 90.7 的成绩;强化学习版把车辆偏离道路率从 24% 降到 12%。不过研究团队与媒体都明确提醒:它目前是「研究模型」,不是道路认证产品——不能把它等同于可上路的完整自动驾驶栈,传感器、定位与整车冗余仍属车端体系。

三、「会解释却对不上动作」的隐患

最值得警惕的是「幻觉逻辑」风险。实测发现,Qwen-Drive 能说清自己为何刹车(如识别到动物或红灯),但这些解释常与实际触发动作不符——有时混淆了不同危险物,有时推理链与驾驶决策自相矛盾。更棘手的是,类似驾驶系统已被研究证明可被摄像头视野里一块带标签的牌子诱导转向行人。这意味着,在自动驾驶这种高风险场景,「能解释」不等于「解释可信」。

四、战略意图:座舱与驾驶合一

把通用知识与专项驾驶能力放进同一个模型,意图是避免「灾难性遗忘」——让一个模型既当司机、又当乘客助手,不必为不同任务各养一个算力昂贵的模型。这对整车电子电气架构「舱驾一体」的方向有现实意义。短期看,Qwen-Drive 更大的价值或许不在替代量产方案,而在为学界与产业提供一个统一的、可复现的研究基线:用一个 VLM 同时验证感知、推理与规划能否真的彼此增益。