先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.00111

Qwen-Drive-1.0:通义千问做的自动驾驶视觉语言基础模型

Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
Xin Zhou,Zongchuang Zhao,Zhibo Yang,Mingsheng Li 等 12 位作者 · 2026-08-31

一个 4B 开源模型同时做三维感知、驾驶问答和轨迹规划

打开交互式解读 →

3 分钟版

问题 驾驶需要三维感知、场景理解和运动规划,而通用视觉语言模型在大量驾驶数据上微调后,往往会丢失广泛的视觉理解和指令遵循能力。

思路 保留 VLM 原架构,做多视角、多帧输入。外部 BEV 感知头联合做三维目标检测、语义占据和 BEV 地图分割,也用来探测共享表示中有多少三维信息。规划专家以 VLM 表示为条件,生成 5 秒、50 个航点的未来轨迹,可选附带一句话的规划理由。四阶段训练:感知头预训练 → 感知与问答联合训练 → 规划专家预训练 → 强化学习(只调规划专家)。

结果 nuScenes 上检测和地图分割取得最好结果;通用视觉语言基准平均 66.41,与 Qwen3.5-4B 的 67.40 相差不到一分,空间理解平均 53.96 反超 52.99。WOD-E2E 测试集经强化学习 RFS 从 7.78 升到 7.91。闭环仿真 AlpaSim 中,强化学习把驶出道路率从 24.0% 减半到 12.0%,但前进进度从 54.0% 降到 48.0%。

所以呢 通用 VLM + 驾驶专用头的路线可行,且通用能力基本保住。强化学习让车更安全但更保守;规划理由与实际轨迹并不总是一致,作者明确列为局限。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。