METAL

DGX Spark连接2台、3台、4台的方法,NVIDIA官方指南给出定论

2台和3台用QSFP线缆直连即可,4台则必须经过交换机。认证线缆清单和自动配置工具都写进了官方文档

DGX Spark连接2台、3台、4台的方法,NVIDIA官方指南给出定论

图片:由 METAL AI 生成

摘要

  • NVIDIA发布了将多台迷你AI计算机DGX Spark用线缆组网的官方用户指南
  • 文档明确规定:2台和3台可用QSFP线缆直连,4台起必须经过交换机才能连接
  • NVIDIA Sync中的Cluster Assistant能自动完成网络配置,但工作负载设置需要另行处理

从一根线缆开始,最多可扩展到四台

NVIDIA官方网站

图示展示了DGX Spark 2~3台时可仅凭线缆直接互联,而从4台起则必须经过交换机这一"关卡"才能实现连接。图示展示了DGX Spark 2~3台时可仅凭线缆直接互联,而从4台起则必须经过交换机这一"关卡"才能实现连接。

NVIDIA整理出了一份官方文档,规定了如何用线缆将多台自家小型AI计算机DGX Spark组合使用。这次明确了一个条件:2台和3台只需接上线缆即可,而从4台开始则必须配备交换机设备。DGX Spark背面各配有两个最高可达200Gb/s速率的QSFP(ConnectX-7)接口,通过在这些接口上插入线缆,即可实现设备之间的互联。

具体来说,NVIDIA此前也曾通过官方X账号介绍过将多台DGX Spark连接起来在本地运行AI的指南。不过当时只是转发了一个名为MiaAI_lab的账号制作的指南,并未确认最多能连接几台、线缆规格是什么。这次NVIDIA亲自发布的用户指南填补了这一空白,具体给出了按台数划分的连接规则、认证线缆清单,以及自动配置工具。

NVIDIA在文档中也明确说明了组建多台集群的目的:是为了将单台DGX Spark容纳不下的规模化任务分摊到多台设备上运行。这一方案针对的是那些希望将笔记本大小的设备连成一体、在无需云端支持的情况下运行更大模型的需求。

按台数划分的连接规则

连接方式必须遵循按台数确定的固定模式。文档不支持直连与交换机连接混用,且每条链路只能使用一根线缆。文档中明确指出,用两根线缆连接两台设备并不会带来性能提升。

配置连接方式所需线缆
2台直连或经交换机直连1根 / 经交换机2根
3台直连(环形结构)或经交换机直连3根 / 经交换机3根
4台仅支持经交换机连接4根(每台设备1根)

3台设备直连时,会形成每台设备都与另外两台相连的环形结构。而从4台开始,已不再支持直连方式,必须经过交换机。

认证线缆与接口规格

NVIDIA建议,在QSFP线缆中也应选用能保证200Gb/s以上速率的产品。即便使用速度更快的线缆,由于接口本身限制在200Gb/s,也不会带来任何好处。文档中明确列出的、专用于以太网配置的认证线缆有两款:Amphenol的NJAAKK-N911(0.5米版本为NJAAKK0006)和Luxshare的LMTQF022-SD-R。

接口本身左右可互换使用,但NVIDIA提供的2台、3台及交换机连接方案手册是按特定接口编写的,因此区分左右插入位置很重要。线缆插入时需让拉环朝上,如果插入时感觉发紧,应先重新确认方向。文档警告称,强行插入可能损坏接口。

一根线缆对应八个接口

DGX Spark内部的ConnectX-7网络控制器通过两条独立的PCIe Gen5 x4链路,将外部QSFP接口与Grace Blackwell SoC连接起来。因此在Linux系统中,一个接口会显示为两个以太网接口,再加上与之对应的RoCE(用于InfiniBand通信)接口,每个接口总共会产生四个网络接口。如果两个QSFP接口都插上线缆,这个数字就会增加到八个。

正因为这种结构,手动配置IP时需要了解PCIe地址与接口名称之间的对应关系,操作起来相当繁琐。NVIDIA的文档专门提供了这份对应表,这也从侧面说明了这项工作有多么不适合人工手动处理。

엔비디아, DGX Spark 클러스터링 공식 가이드 공개

网络交给工具,工作负载另行处理

替用户完成这套复杂配置的,正是NVIDIA Sync中的Cluster Assistant。只要线缆连接正确,它就能自动发现设备、应用ConnectX-7网络配置、检测链路性能,并完成节点间的SSH配置。这款工具的目的就是让用户无需了解网络或PCIe架构也能完成设置。

不过,这款工具的能力也仅限于此。文档明确指出,推理或微调等实际工作负载的配置并不属于Cluster Assistant的范畴。网络搭建完成后,还需借助NCCL、vLLM、PyTorch微调等专门的操作手册来部署工作负载。Cluster Assistant最多支持3台设备直连,4台则需经交换机连接。

如何上手操作

  1. 准备线缆:根据设备台数,准备Amphenol NJAAKK-N911或Luxshare LMTQF022-SD-R线缆。
  2. 物理连接:面向DGX Spark背面,将线缆插入QSFP接口,确保拉环朝上。如果插入不顺畅,需重新确认方向。
  3. 设备注册与更新:将各台DGX Spark用账号注册到NVIDIA Sync,并在DGX Dashboard中更新至最新软件版本。
  4. 运行Cluster Assistant:在NVIDIA Sync中打开Cluster Assistant,即可自动发现已连接的设备,并完成网络配置和SSH设置。
  5. 部署工作负载:网络搭建完成后,从NCCL、vLLM、PyTorch微调手册中选择所需内容,运行实际任务。

编辑视角

去年8月初,关于NVIDIA AI账号在X上发布的那条帖子,我们当时能确认的信息仅止于"据说可以连接多台设备"这一层面。至于具体能连几台、该用什么线缆,当时完全是一片空白。观察这次文档如何填补这一空白,能读出NVIDIA的策略:它试图将DGX Spark定位为一种可在桌面上逐步扩展的个人AI基础设施,而非数据中心级超级计算机。2台和3台开放为仅需一根线缆即可实现,而4台起要求交换机,这看起来像是一条精心划定的界线——既留住小型实验室和个人开发者,又将真正的规模化扩展引导向网络设备的投资。

同一时期,Perplexity推出的一款可在单台DGX Spark上运行、无需依赖云端的便携式电脑,也处在同一条脉络上。既然已经出现了在单台本地硬件上运行编排器和子代理LLM的实验,那么当需要更大模型或更多并发任务时,下一个选项自然就是这次被文档化的集群方案。从一台起步、按需扩展台数的路径,如今已在文件层面完成了闭环。

对于国内关注本地AI部署的开发团队来说,这份文档能带来的实际启示很明确:Cluster Assistant确实能代劳网络配置,但用NCCL或vLLM运行实际的分布式推理与训练,仍是需要另外掌握的专业领域。在决定购买集群之前,应先确认团队中是否有人能够驾驭这些操作手册。相比线缆规格选错导致达不到200Gb/s,更常见的情况恐怕是网络搭好了,却卡在了上层工作负载的配置环节。

未来几周内,基于这份集群配置文档的实际基准测试或使用体验很可能会陆续出现。既然NCCL、vLLM操作手册已被提及,那么针对2台、3台、4台不同配置下实际推理速度的对比,自然会成为下一步的关注焦点。

评论