先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.00111
Qwen-Drive-1.0:通义千问做的自动驾驶视觉语言基础模型
Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving
Xin Zhou,Zongchuang Zhao,Zhibo Yang,Mingsheng Li 等 12 位作者 · 2026-08-31
一个 4B 开源模型同时做三维感知、驾驶问答和轨迹规划
打开交互式解读 →3 分钟版
问题 驾驶需要三维感知、场景理解和运动规划,而通用视觉语言模型在大量驾驶数据上微调后,往往会丢失广泛的视觉理解和指令遵循能力。
思路 保留 VLM 原架构,做多视角、多帧输入。外部 BEV 感知头联合做三维目标检测、语义占据和 BEV 地图分割,也用来探测共享表示中有多少三维信息。规划专家以 VLM 表示为条件,生成 5 秒、50 个航点的未来轨迹,可选附带一句话的规划理由。四阶段训练:感知头预训练 → 感知与问答联合训练 → 规划专家预训练 → 强化学习(只调规划专家)。
结果 nuScenes 上检测和地图分割取得最好结果;通用视觉语言基准平均 66.41,与 Qwen3.5-4B 的 67.40 相差不到一分,空间理解平均 53.96 反超 52.99。WOD-E2E 测试集经强化学习 RFS 从 7.78 升到 7.91。闭环仿真 AlpaSim 中,强化学习把驶出道路率从 24.0% 减半到 12.0%,但前进进度从 54.0% 降到 48.0%。
所以呢 通用 VLM + 驾驶专用头的路线可行,且通用能力基本保住。强化学习让车更安全但更保守;规划理由与实际轨迹并不总是一致,作者明确列为局限。
关键数字
- 7.91 WOD-E2E 测试集 RFS(强化学习后)(§3.3)
- 12.0% 闭环仿真驶出道路率(强化学习后)(§3.3 · Table 7)
- 66.41 通用视觉语言基准平均分(§3.2.2)
- 2.83M 训练样本数(公开来源)(§3.3)
局限与疑问
- 规划理由的因果判断不稳定,轨迹不总是遵循理由(作者自述)。
- 强化学习后行为更保守,进度下降。
- 验证集超过人类参考属于样本内优化。
- 三个任务输入格式不统一,可能限制迁移。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。