阿里千问团队近日宣布开源一款专为自动驾驶设计的视觉语言模型——Qwen-Drive-1.0-4B。该模型基于Qwen3.5-4B架构开发,首次将3D感知、视觉问答与运动规划功能整合于统一框架中,为自动驾驶领域提供了全新的技术路径。

与传统自动驾驶模型不同,Qwen-Drive-1.0在预训练阶段即实现了多任务统一。研发团队通过创新的数据融合方式,将3D空间感知、驾驶场景语义理解与车辆运动规划三大核心能力同步训练,同时完整保留了原始视觉语言模型(VLM)的架构特性。这种设计使模型既能精准识别道路环境中的三维信息,又能理解复杂交通场景的语义逻辑,并直接输出符合物理规律的车辆控制指令。
训练方案采用分阶段策略,首先通过大规模通用视觉语言数据构建基础能力,再引入驾驶领域专用数据强化特定场景表现。这种训练方式使模型在保持通用视觉理解能力的同时,显著提升了在自动驾驶任务中的专业性能。官方测试数据显示,该模型在3D目标检测、交通标志识别、障碍物轨迹预测等关键指标上均达到行业领先水平。

为确保模型实用性,研发团队构建了覆盖全驾驶周期的评估体系。从开环环境下的轨迹预测精度,到伪闭环场景中的决策合理性,再到真实闭环驾驶的安全性验证,模型经历了多维度严格测试。特别值得关注的是,强化学习优化后的版本在保持微小位移误差的前提下,显著提升了与人类驾驶习惯的契合度,同时在紧急避障等安全关键场景中表现出色。
该模型所有训练数据均来自公开数据集,研发团队通过统一不同数据源的轨迹标注格式,解决了多数据集兼容难题。这种开放策略不仅降低了模型部署门槛,也为学术界和产业界提供了可复现的研究基准。目前,Qwen-Drive-1.0-4B已同步开放监督微调(SFT)和强化学习(RL)两个版本的模型权重,供全球开发者研究使用。

