阿里千问团队9月6日正式开源Qwen-Drive-1.0-4B,这是国内首个面向自动驾驶的视觉语言基础模型。该模型基于Qwen3.5-4B构建,预训练阶段统一了3D感知与视觉问答,并进一步扩展至运动规划,完全保留了预训练VLM的原始架构。
从技术框架看,Qwen-Drive-1.0仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,从开环预测到闭环驾驶全面评估。经过强化学习后,该模型仅以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。
与国内其他自动驾驶模型相比,Qwen-Drive-1.0的突破在于将3D感知、视觉理解和运动规划统一在同一个VLM架构下,避免了传统方案中感知、预测、规划三个模块孤立运行的缺陷。这种“一体化”设计让模型能够在动态场景中实现更好的推理能力。
从产业影响来看,阿里这次开源不仅降低了自动驾驶研发的门槛,更为中小型公司和研究机构提供了一个可直接使用的基础框架。在国内自动驾驶赛道益发爆的背景下,这一开源举措将加速行业技术扩散与创新融合。
一句话总结:Qwen-Drive-1.0的开源标志着国内AI自动驾驶模型迈入新阶段,一体化VLM架构或成行业新标准。
AI 生成 . DeepSeek | 搜索综合