
이미지: X — 인프라·칩 화면 갈무리
摘要
- NVIDIA发布了开源模型Nemotron 3.5 Lightning,总参数量为30B的MoE架构,激活参数为3B
- 公司表示,该模型的输出速度比同等规模模型最高快4倍
- 发布当天该模型即已在Together AI上线,可直接调用
- 모델명
- NVIDIA Nemotron 3.5 Lightning
- 구조
- 오픈 30B MoE, 활성 파라미터 3B
- 성능 주장
- 동급 크기 모델 대비 최대 4배 출력 속도(NVIDIA 발표)
- 타깃 용도
- 대량·특화 작업을 처리하는 상시 구동(always-on) 에이전트
- 제공처
- Together AI에 공개 당일 서비스 개시
- 발표 시점
- 2026년 8월 11일
加载30B,但只用3B
NVIDIA发布了旗下开源模型系列Nemotron的新作Nemotron 3.5 Lightning。该模型总参数量为300亿,但生成一个token时实际参与运算的参数仅为30亿。官方表示,正是这种结构使其比同等规模的模型快出最多4倍的速度。其瞄准的应用场景也十分明确:全天候不间断运行的智能体,以及需要大批量重复处理固定任务的场景。
同一天,推理服务商Together AI将该模型上线到自家平台。Together AI将其介绍为"同级别中最快的开源模型"。从发布到上线服务之间几乎没有间隔这一点也可以看出,这款模型并非用于展示的研究成果,而是从设计之初就打算直接接入API使用的产品。
为何"激活参数"比模型名称本身更重要
MoE(混合专家,Mixture of Experts)是指在模型内部设置多个被称为"专家"的子神经网络,针对每次输入只挑选其中一部分来使用的方式。这就好比建好了整座图书馆,但每次提问只打开其中所需的一两个书架。知识总量达到30B级别,但运算成本和响应延迟却接近3B级别。这也是过去一年里发布的大多数开源模型都采用这种结构的原因所在。今年8月9日发布的Qwen的Qwen-AgentWorld-35B-A3B同样是总参数35B、激活参数3B。总量在30B档,激活量在3B档——这已逐渐成为开源阵营中一种近似标准的规格区间。
速度为何变得如此重要,这一点也值得关注。在人一问一答式的聊天机器人场景中,慢个一秒钟并不会太明显。但智能体为了完成一项任务,会自行调用模型数十次,有时甚至数百次。一次调用的延迟会随调用次数成倍放大。因此出现了这样一个区间:即便在精度上略作让步,多次运行更快、更便宜的模型反而更有利。而"Lightning"这个名字,正是精准瞄准了这一点。
NVIDIA身为GPU公司却持续推出开源模型,背景也是同样的逻辑。今年7月,该公司与200多家企业及机构联署了一份支持开放权重的公开信,此后又相继发布了物理AI基础模型Cosmos 3、用于量子计算机校准的视觉语言模型Ising 1.5。能在自家硬件上运行的模型在世界上越多,芯片需求也会随之增长。
因此,这意味着什么
对于正打算将智能体接入实际服务的团队来说,又多了一个选项。用前沿模型处理一切,单次调用的成本和延迟都构成负担;而用小型模型,任务完成率又会下降——这30B/3B的区间恰好填补了这一中间地带。通过Together AI,无需自备GPU即可直接测试性能,这一点在实务操作上意义也很大。基准测试分数和许可条款等细节仍需等模型卡公开后加以验证,但可以明确的是,这款模型正好落在了从"一个大模型"转向"多次运行的快速模型"这一重心转移的趋势线上。



