🎯 科技 · AI应用

🔥 阿里千问开源首个自动驾驶VLM,中国AI"去闭源"再下一城

一、开源即入局:AI驱动自动驾驶的"中国方案"

9月6日,阿里千问正式开源Qwen-Drive-1.0-4B,这是业界首个面向自动驾驶场景的视觉语言基础模型(VLM)。该模型基于千问3.5架构打造,核心突破在于将3D环境感知、视觉问答与运动规划三大能力统一在同一基座之上,实现了从"看懂"到"行动"的跨越。据阿里官方披露,Qwen-Drive-1.0在强化学习后,仅以微小的开环位移误差为代价,便在人类偏好对齐和闭环安全性上取得全面提升。这意味着中国自动驾驶AI正从"闭源黑盒"迈向开源生态,与全球开发者共享技术红利。

开源是阿里千问近年来在AI领域的核心策略之一。继Qwen3.5大模型开源后,千问APP自2025年11月公测以来,首周下载量即超1000万,目前C端月活跃用户已突破3亿。此次将自动驾驶模型开源,被视为千问从通用大模型向垂直领域全面渗透的关键一步。据媒体报道,该模型仅使用公开来源数据构建规划样本,统一了各数据集的轨迹格式,并完成了从开环预测到闭环驾驶的全面评估。

二、为什么自动驾驶需要"视觉语言模型"?

传统自动驾驶方案采用模块化架构,由感知、定位、预测、规划等独立模块拼接而成。这种"堆栈式"方案调试成本极高,且模块间的信息损耗容易引发连锁错误。而VLM的核心优势在于"端到端理解"——通过多模态大模型统一处理视觉输入和语言指令,让AI具备类似人类驾驶时的"场景理解力"。例如,面对一个"施工路段+交警指挥"的复杂路口,传统方案需要各模块分别识别和决策,而VLM可以直接理解"这是临时管制,按手势通行"的语义。

开源自动驾驶模型的意义不仅在于技术,更在于生态。全球自动驾驶竞争已进入"数据+算法+算力"的军备竞赛阶段。特斯拉FSD通过百万级真实路数据训练端到端模型,Waymo则以高精度地图+闭源算法构建护城河。阿里此次开源Qwen-Drive,相当于为中国自动驾驶产业提供了一个可自由定制的基座模型,中小车企和初创公司无需从零训练,即可基于此进行垂直场景适配,加速智驾平权进程。

三、开源之后:中国AI的"生态战"正式开打

回顾近两年中国大模型发展轨迹,从百模大战到头部收敛,开源已成为差异化竞争的核心策略。华为MindSpore、阿里通义千问、百度文心一言均在开源生态上加大投入,目的正是通过开发者社区形成"技术飞轮"——开源→生态→反馈→迭代→更强开源。自动驾驶作为AI落地最复杂的场景之一,其技术外溢效应极为显著:VLM在驾驶场景中的感知-决策一体化能力,同样可迁移至机器人、智能座舱、智慧物流等泛具身智能领域。

当前,全球自动驾驶市场正经历从L2向L3/L4的跨越期。IDC预测,2026年全球L2+渗透率将突破45%,中国作为最大单一市场贡献超60%增量。在此背景下,开源模型能否催生出中国版的"自动驾驶Android",将决定中国智驾产业链在全球竞争中的话语权。阿里千问的这一步,值得持续关注。

综合IT之家、第一财经报道 | 2026年9月7日