阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型

阿里千问本周开源了 Qwen-Drive-1.0-4B,这是一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。官方表示,Qwen-Drive-1.0 是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时完全保留了预训练 VLM 的原始架构。

Qwen-Drive-1.0-4B 的构建基础

IT之家 9 月 6 日消息显示,阿里千问本周开源了 Qwen-Drive-1.0-4B。这款模型基于 Qwen3.5-4B 构建而成。作为自动驾驶视觉语言模型,它直接继承了 Qwen3.5-4B 的基础能力,并在此之上针对自动驾驶场景进行了专门适配。

开源时间点落在本周,标志着阿里千问在自动驾驶领域的一次重要模型发布。Qwen-Drive-1.0-4B 的参数规模为 4B,这与基础模型 Qwen3.5-4B 保持一致。这种构建方式让模型能够在保持较小规模的同时,专注于自动驾驶相关任务的优化。

首个自动驾驶视觉语言基础模型定位

阿里千问开源 Qwen-Drive-1.0-4B:首个面向自动驾驶的视觉语言基础模型:首个自动驾驶视觉语言基础模型定位

官方明确表示,Qwen-Drive-1.0 是首个面向自动驾驶的视觉语言基础模型。这一定位突出了其在行业内的开创性地位。在此之前,尚未有专门针对自动驾驶场景设计的视觉语言基础模型出现。

这一声明强调了 Qwen-Drive-1.0-4B 在自动驾驶与视觉语言模型结合领域的领先位置。它不仅是一个视觉语言模型,更是为自动驾驶量身打造的基础版本。这种基础模型的定位,为后续在自动驾驶领域的进一步开发和应用奠定了基础。

预训练阶段的多任务统一

Qwen-Drive-1.0-4B 在预训练阶段实现了 3D 感知与视觉问答的统一。这一设计让模型能够在单一预训练过程中同时掌握两种核心能力,避免了传统方法中需要分别训练不同模块的复杂性。

统一后的模型能够更高效地处理自动驾驶场景中的感知和问答需求。3D 感知负责理解车辆周围的三维环境,而视觉问答则让模型能够基于视觉输入回答相关问题。这种多任务统一的方式,提升了模型在复杂驾驶环境中的整体表现。

原始 VLM 架构的完整保留

模型在开发过程中完全保留了预训练 VLM 的原始架构。这一决定确保了 Qwen-Drive-1.0-4B 能够继承原始视觉语言模型的所有基础特性,而不会因为针对自动驾驶的调整而丢失通用能力。

保留原始架构意味着模型依然保持了标准的 VLM 结构,包括视觉编码器和语言模型部分的连接方式。这种完整保留为模型后续的扩展和迁移提供了便利,也让研究者能够更容易地理解和进一步优化其内部机制。

分阶段训练方案

Qwen-Drive-1.0-4B 采用了分阶段训练方案。这一方案将驾驶监督与通用视觉语言训练相结合,通过不同阶段的针对性优化,实现模型在自动驾驶领域的专项能力提升。

分阶段训练首先注重基础视觉语言能力的巩固,随后逐步引入驾驶相关的监督信号。这种方式避免了直接将驾驶数据与通用数据混合可能带来的冲突,让模型能够在保持通用能力的同时,逐步掌握自动驾驶所需的特定知识。

驾驶监督部分聚焦于真实驾驶场景中的决策和感知需求,而通用视觉语言部分则继续强化模型的问答和理解能力。两者结合形成了 Qwen-Drive-1.0-4B 独特的能力结构。

从感知到规划的能力扩展

在预训练阶段,Qwen-Drive-1.0-4B 进一步将能力扩展至运动规划。这一扩展意味着模型不再局限于感知和问答,而是能够直接参与到车辆的运动决策过程中。

从 3D 感知和视觉问答统一,到加入运动规划,体现了模型能力的逐步深化。运动规划能力让模型可以基于感知到的环境信息,生成合理的驾驶轨迹和动作规划。这种从感知到规划的完整链路,为端到端自动驾驶解决方案提供了重要支持。

预训练阶段的这一扩展,让 Qwen-Drive-1.0-4B 在自动驾驶全流程中具备更强的适用性。模型能够将视觉输入直接转化为规划输出,减少了中间环节可能引入的误差。

官方发布的这些特性共同构成了 Qwen-Drive-1.0-4B 的核心优势。作为开源模型,它为自动驾驶研究社区提供了新的基础工具。未来开发者可以在此基础上继续构建更复杂的自动驾驶系统。

Qwen-Drive-1.0-4B 的发布也反映出阿里千问在视觉语言模型领域的持续投入。从通用模型 Qwen3.5-4B 到针对自动驾驶的专项版本,展示了技术从通用向垂直领域迁移的路径。

整个模型设计强调统一性和架构保留,这为类似领域的模型开发提供了参考。分阶段训练和多任务统一的方式,或许会在更多场景中得到应用。

随着开源代码和权重逐步被社区使用,Qwen-Drive-1.0-4B 有望在实际自动驾驶项目中发挥作用。其作为首个此类基础模型的地位,也将推动自动驾驶视觉语言模型的进一步发展。