阿里千问开源自动驾驶视觉语言模型Qwen-Drive:统一感知、问答与规划

    发布时间:2026-09-07 11:28 更新时间:2026-09-07 11:28 阅读量:2

    国产开源大模型阵营在智能驾驶领域再落一子。阿里通义千问团队近日宣布开源面向自动驾驶的视觉语言基础模型 Qwen-Drive-1.0-4B。官方介绍称,这是首个面向自动驾驶场景的视觉语言基础模型之一,其核心特色在于通过预训练将3D环境感知与视觉问答能力进行统一建模,并进一步将能力扩展至运动规划任务。

    从"看懂路"到"理解场景",VLM进入自动驾驶

    与传统自动驾驶方案依赖多个独立感知模块不同,视觉语言模型(VLM)尝试将"看见"与"理解"融为一体。Qwen-Drive在预训练阶段便统一了3D感知与视觉问答两大任务,使模型既能识别道路上的车辆、行人、交通标志等三维目标,又能对复杂交通场景进行语义理解与推理。这种"感知+认知"一体化的建模思路,被视为提升自动驾驶系统在长尾场景下泛化能力的重要探索方向。

    不止于感知:能力延伸至运动规划

    更具看点的是,Qwen-Drive并未止步于环境理解,而是将能力进一步扩展到运动规划环节。这意味着模型不仅能够描述"路上发生了什么",还能基于对场景的理解给出相应的驾驶决策建议,向"端到端"的智能驾驶方案迈出了关键一步。这一技术路线若能在真实场景中得到充分验证,有望为高阶辅助驾驶乃至无人驾驶提供新的算法底座。

    开源策略:为行业提供可复用的研发底座

    此次开源的Qwen-Drive-1.0-4B模型采用4B参数规模,兼顾了性能与部署成本,便于学术界与产业界在此基础上进行二次开发。延续千问系列一贯的开源路线,阿里希望通过开放模型权重与研究细节,降低自动驾驶AI研发的准入门槛,吸引更多团队共同推动多模态大模型在车端与路侧场景的落地应用。

    展望:大模型重塑智能驾驶技术栈

    从行业趋势来看,以大模型为代表的AI技术正在深刻重塑自动驾驶的技术栈。无论是环境感知、决策规划还是人机交互,多模态大模型都展现出巨大的潜力。Qwen-Drive的开源,既是中国大模型团队在垂直行业落地的又一次尝试,也为"AI+出行"的融合创新提供了新的想象空间。后续该模型在真实路测中的表现,以及围绕它所形成的开源生态,值得业界持续关注。

    继续阅读

    📑 📅
    国内首款AI辅助创新药艾普司韦获批:DEL技术沉淀34年终落地 2026-09-07
    卧安机器人更新招股书:2025上半年扭亏为盈,冲刺“AI家庭机器人第一股” 2025-12-10
    软银英伟达联手豪掷超100亿,押注“机器人大脑”Skild AI,估值半年翻两倍 2025-12-10
    从“机械手臂”到“知心伴侣”:AI如何重塑机器人,迈向真正的“人类伙伴”时代 2025-12-10
    星际“老司机”上岗:斯坦福AI技术让空间站机器人规划效率飙升60% 2025-12-10
    月之暗面被曝秘密递交港股上市申请:目标募资30亿美元,估值剑指500亿 2026-09-08
    千问办公上线"多人工作台":最高支持百人实时协作,国产AI办公竞赛再升温 2026-09-08
    讯飞发布星火X2.5系列,端侧模型支持百万Token上下文 2026-09-09
    腾讯混元开源Hy4 preview:770B参数主攻生产力场景 2026-09-09
    AI大模型融资竞赛升温 字节阿里等密集输血 2026-09-09