9月6日,阿里巴巴旗下通义实验室正式开源Qwen-Drive-1.0-4B自动驾驶视觉语言模型。该模型基于Qwen3.5-4B构建,是全球首个面向自动驾驶的视觉语言基础模型。其创新性在于统一3D感知与视觉问答预训练,并扩展至运动规划,同时保留原VLM架构。采用分阶段训练,融合驾驶监督与通用多模态数据,支持SFT与RL双规划专家。评测覆盖3D感知、场景理解、通用视觉语言能力及开环/伪闭环/闭环规划。所有规划样本均来自公开数据,轨迹格式统一,强化学习后显著提升人类偏好对齐与闭环安全性。
免责声明:本文内容由开放的智能模型自动生成,仅供参考。



