
이미지: NVIDIA
摘要
- 英伟达宣布,已在Vera Rubin NVL72机架级系统中集成推理加速器Groq 3 LPX,正式进入全面量产阶段。
- 在Artificial Analysis的基准测试中,开源智能体模型Gemma 4 31B在10万令牌上下文下运行,输出速度达到每秒3,400个令牌,比最接近的竞品平台快4倍。
- 公告同时披露,SpaceXAI率先部署Vera CPU、CoreWeave率先部署Spectrum-X Multiplane网络、Nebius率先采用Groq 3 LPX。
- 발표 계기
- 미국 팔로알토 Hot Chips 콘퍼런스, 2026년 8월 24일
- 시스템
- NVIDIA 베라 루빈 NVL72 랙스케일 시스템 + Groq 3 LPX, 완전 양산(full production) 단계
- 벤치마크
- 아티피셜 애널리시스 측정, Gemma 4 31B 기준 10만 토큰 문맥에서 초당 3,400 출력 토큰 (대안 대비 4배)
- 파트너
- SpaceXAI(베라 CPU 채택), CoreWeave(Spectrum-X Multiplane 상용 배포), Nebius(Groq 3 LPX 첫 채택 클라우드)
- 네트워크 확장성
- Spectrum-X Multiplane, 3계층 추가 없이 최대 GPU 51만2,000개까지 확장
- 네트워크 복원력
- 8플레인 구성 기준 한 플레인 장애 시 대역폭 약 90% 유지, 하드웨어 복구가 소프트웨어 방식보다 11배 빠름
- 스위치 사양
- Spectrum-X SN6000 시리즈, 102.4Tb/s Spectrum-6 이더넷 ASIC + ConnectX-9 SuperNIC, GPU당 최대 1,600Gb/s
- 신규 네트워킹 축
- 다섯 번째 축 'Scale-In', NVIDIA BlueField-4 프로세서·DOCA 소프트웨어 기반
智能体回答一个问题所需的时间,是由一个个令牌累积而成的。在调用工具、与其他智能体协作的过程中,这些延迟会层层叠加,用户实际感受到的响应延迟很快就会被放大。英伟达本周在美国帕洛阿尔托举行的Hot Chips大会上,给出的答案是一款新的推理加速器。8月24日,英伟达宣布已将Groq 3 LPX集成进Vera Rubin NVL72机架级系统,正式进入全面量产阶段。
智能体时代,"令牌生成速度"才是瓶颈
随着AI从训练阶段转向推理阶段,基础设施需要承担的任务也发生了变化。智能体不再是一问一答就结束,而是要不断推理、调用工具、与其他AI系统交换信息,持续生成令牌。上下文窗口——也就是AI一次能记住并读取的内容量——也在不断变大。英伟达指出,这一趋势需要一种与训练基础设施不同的新型基础设施,能够同时兼顾吞吐量、响应速度和成本效率。
英伟达强调的重点不是单独优化各个部件,而是"极限协同设计"(extreme co-design)。也就是说,Vera Rubin的算力、Spectrum-X以太网的网络能力、Groq 3 LPX的推理加速被作为一个整体系统统一设计。其中Rubin GPU负责处理大规模上下文,LPX则加速对延迟敏感的解码(令牌生成)任务,两者分工协作。
10万令牌上下文下,每秒3,400个令牌
实际性能由Artificial Analysis——一家独立测评模型速度与价格的分析机构——的基准测试给出。开源智能体模型Gemma 4 31B在10万令牌的长上下文环境下运行时,输出速度达到每秒3,400个令牌。这一指标对智能体系统尤为关键,英伟达表示,该数值比最接近的竞品平台快4倍。
以单个机架规模计算,Groq 3 LPX的部署最多可将256个LPU加速器通过芯片间直连链路组合在一起。据介绍,这样聚集起来的LPU集群,会像一个专为确定性推理(即相同输入始终产生相同延迟)优化的巨型处理器一样运行。
SpaceXAI、CoreWeave、Nebius率先接入
此次发布中,三家已实际部署该平台的企业一同亮相。
| 合作伙伴 | 部署内容 |
|---|---|
| SpaceXAI | 计划在从地面数据中心到轨道卫星的下一代智能体AI架构中部署Vera CPU |
| CoreWeave | 已将连接Vera Rubin机架的Spectrum-X Multiplane部署到生产环境 |
| Nebius | 首家采用Groq 3 LPX的AI云服务商,将其集成进自家的Token Factory |
SpaceXAI表示,计划利用Vera CPU加速编排、工具调用、代码执行、数据处理、仿真等对CPU负载要求较高的智能体任务。CoreWeave已将通过多台交换机并联、构建高带宽无损网络的Spectrum-X Multiplane投入生产环境。Nebius则表示,将把Groq 3 LPX加入其推理服务Token Factory,以提升编程智能体等实时服务的响应速度。
网络也在同步升级——Spectrum-X Multiplane
随着AI工厂规模不断扩大,瓶颈往往先出现在网络而非芯片上。按传统方式扩展集群,需要额外增加第三层网络,这样一来延迟会增加,线缆、光模块和电力成本也会随之上升。Spectrum-X Multiplane通过将单台服务器的网络连接拆分为多个独立的"平面"(plane),让每个平面作为独立的二层网络运行,从而规避了这一问题。据介绍,这样一来,无需第三层网络,也能构建出可扩展至51.2万块GPU的扁平化网络。
这种分布和故障应对由ConnectX SuperNIC内置的专用硬件引擎自动完成。英伟达表示,在8平面配置下,即便一个平面失效,整体带宽仍能保持约90%,恢复速度比基于软件的方式快11倍。若换算成AI工厂的整体吞吐量,则意味着产出提升1.6倍。支撑这一结构的硬件包括基于102.4Tb/s级Spectrum-6以太网ASIC的SN6000系列交换机,以及单GPU最高支持1,600Gb/s的ConnectX-9 SuperNIC。此外,借助将多个数据中心整合为一个超级工厂的Spectrum-XGS以太网,跨站点协同运算(NCCL collectives)速度可提升1.9倍。
第五个维度:Scale-In
英伟达此次还同步推出了网络架构的新维度,名为Scale-In,构建在BlueField-4处理器与DOCA软件平台之上,通过Spectrum-X以太网连接。英伟达介绍称,这一架构将原本被视为数据中心内外接入网络(南北向)的区域,整合成一个统一的加速基础设施域。
英伟达的逻辑是:随着智能体不断与数据、存储、服务交互,如今安全、运维、存储也必须与算力一同被加速。据介绍,Scale-In提供多租户网络、高性能存储访问、芯片级安全、弹性资源调配和实时可观测性,同时将基础设施处理与主机计算资源分离开来。
编辑视角
这次发布用一句话概括,就是英伟达正处在从"卖训练用GPU的公司"转向"卖整条推理流水线的公司"的过渡阶段。Groq 3 LPX、Spectrum-X Multiplane、Scale-In三项技术在同一天、同一场大会上被打包推出,绝非偶然。训练时代只需衡量GPU数量和带宽,但智能体推理要同时应对延迟、上下文长度、网络故障恢复等一系列问题,英伟达自己也意识到,如果不把整套基础设施拿来协同设计,就没有什么可卖的了。
过去,扩大GPU集群规模就等同于性能扩展,但这次发布说明这个等式已经不再成立。比起每秒3,400个令牌这个数字本身,更值得关注的是它是在10万令牌的长上下文条件下测出来的。短提示词下跑得快,谁都能做到,真正的瓶颈是在对话变长、工具调用层层叠加之后才会显现出来的。如果国内团队正在筹备智能体类服务,现在只用短上下文跑基准测试就放心,是有风险的。更应该做的是,用实际服务中会用到的上下文长度去实测延迟。
网络方面的数字也值得从实操角度细品。一个平面失效仍能保住90%带宽,这意味着不必为应对故障而额外囤置冗余基础设施。对于不自建基础设施、而是通过云服务商租用GPU的国内创业公司来说,在签约前问清楚这种架构是否真的会反映在费用或稳定性上,是划算的做法。
未来几周内,实际搭载Groq 3 LPX的云服务商很可能会继续增多。英伟达自己也表示,这次发布"只是开始",后续还会有更多模型适配和优化跟进,所以可以预期,这次的基准数据在下一代产品中还会被再次刷新。




评论