
이미지: METAL LAB 생성
摘要
- NVIDIA发布了用于自动驾驶开发的开源模型Alpamayo 2 Super
- 该模型结合了320亿参数的Cosmos 3 Super Reasoner与20亿参数的Action Expert,总规模达340亿参数
- 它可在单一模型中处理轨迹预测、推理、元动作、视觉问答及自动标注
- 모델명
- NVIDIA Alpamayo 2 Super
- 총 파라미터
- 340억(32B Reasoner + 2B Action Expert)
- 지원 카메라
- 최대 7대, 360도 인식
- 궤적 예측 성능
- minADE_6 0.911m로 보고됨
- 라이선스
- OpenMDW-1.1, 상업적 재배포 허용
- 공개 경로
- Hugging Face 가중치, GitHub 추론 노트북
NVIDIA发布了面向自动驾驶汽车(AV)开发的开源推理型视觉-语言-动作(VLA)模型“Alpamayo 2 Super”。该模型由320亿参数规模的Cosmos 3 Super Reasoner与20亿参数、基于扩散的Action Expert组成,总计340亿参数,并通过强化学习进行了后续训练。
面向统一工作流
以往的自动驾驶开发中,轨迹生成、意图预测、场景理解和数据标注一直由各自独立的模型分别处理。Alpamayo 2 Super将这些功能整合进一个基础模型中,支持最多7个摄像头的360度感知,同时输出未来轨迹、Chain-of-Causation推理轨迹、高层级元动作、包含2D定位的场景问答,以及推理自动标签。
NVIDIA表示,该模型可在离线策略教师、评估评审、数据引擎,以及新任务定制的起点等开发工作流的多个环节中作为通用基础使用。
基准测试结果
据公开资料显示,该模型在轨迹预测(minADE_6)上取得0.911米,AV推理得分0.433,LingoQA得分79.2,元动作IoU方面横向为74.59、纵向为61.91、按车道为73.55,视觉问答答案相似度为0.652,2D定位IoU为0.71,闭环AlpaSim得分为1.50(±0.13),均优于现有模型的表现。
NVIDIA表示,模型权重已在Hugging Face公开,推理笔记本已上传至GitHub,并采用Linux Foundation的开放许可协议OpenMDW-1.1,允许进行微调、衍生模型开发及商业再分发。



