英伟达首席执行官黄仁勋近日在社交平台发布推文,重点介绍了公司最新推出的自动驾驶开源模型Alpamayo 2 Super。这款被定位为视觉语言动作(VLA)架构的模型,标志着英伟达在自动驾驶技术领域迈出关键一步。黄仁勋特别强调,AI技术发展的下一阶段将聚焦机器人领域,而自动驾驶将成为这一变革的起点。
作为专为自动驾驶车辆设计的开放推理模型,Alpamayo 2 Super具备突破性的环境理解能力。该模型不仅能通过视觉系统感知周围环境,更能对复杂场景进行深度分析,在执行动作前完成多维度推理。这种"先思考后行动"的特性,使其成为机器人出租车、物流卡车、城市穿梭车等自动驾驶载具的核心技术支撑。
技术架构方面,Alpamayo 2 Super采用混合专家模型设计,由320亿参数的Cosmos 3 Super Reasoner视觉语言骨干网络,与23亿参数的动作决策模块共同构成。总参数规模达340亿的该模型,其计算效率较前代产品提升200%,同时支持从基础感知到路径规划的全栈自动驾驶功能。模型基于NVIDIA Cosmos世界基础模型开发,通过OpenMDW-1.1开放权重协议,允许全球开发者进行模型调优与定制化部署。
在训练数据构建上,研发团队采集了超过1727小时的真实驾驶场景数据,涵盖城市道路、高速公路、复杂天气等多样化环境。配套发布的AlpaSim开源评估框架,可对模型在3D空间定位、动态障碍物预测等20余项关键指标进行量化测试。基准测试数据显示,该模型在3D视觉定位精度上达到71.0%的IoU值,较同类闭源模型提升318%;横向动作预测准确率达74.6%,超出行业平均水平57%。
这款面向L4级自动驾驶系统开发的模型,已实现感知、决策、规划、控制全链条的技术覆盖。其开源特性使得汽车制造商和科技公司能够直接获取底层技术框架,通过微调适配不同车型的自动驾驶需求。黄仁勋在推文中特别指出,开放技术生态将加速自动驾驶系统的安全验证进程,通过全球开发者的协同优化,推动整个行业的技术可靠性提升。
