工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Mac Studio M5 Ultra,四台组网可实现4.8TB/s带宽

苹果发布搭载M5 Max与M5 Ultra的新Mac Studio,以及搭载M6、M5 Pro的新Mac mini,借集群方案瞄准本地大模型市场

실버색 소형 컴퓨터 본체의 뒷면 포트와 통풍구 모습

이미지: apple.com

摘要

  • 苹果发布了搭载M5 Max、M5 Ultra的新款Mac Studio,以及搭载M6、M5 Pro的新款Mac mini
  • 借助Thunderbolt 5和RDMA技术,多台设备可以组网连接,EXO Labs表示四台Mac Studio组成的集群带宽可达约4.8TB/s
  • 两款产品今天起开放预订,9月22日开始发货
Mac Studio 탑재 칩
M5 Max, M5 Ultra
Mac Studio 최대 사양
GPU 80코어, 통합메모리 512GB, 대역폭 1.2TB/s
Mac mini 탑재 칩
M6(애플 첫 2나노 칩), M5 Pro
Mac mini M6 LLM 처리속도(LM Studio)
M1 대비 13.5배, M4 대비 4.8배
Mac mini M5 Pro LLM 처리속도(LM Studio)
M2 Pro 대비 8.5배, M4 Pro 대비 4배
4대 클러스터 AI 추론 속도(애플 발표)
단일 시스템 대비 최대 3배
4대 M5 Ultra 클러스터 통합 대역폭(EXO Labs)
약 4.8TB/s
사전주문·출시일
8월 25일 사전주문 시작, 9월 22일 배송 시작

苹果表示,四台Mac Studio组网后,内存带宽可达每秒4.8太字节。过去要达到这样的速度,需要多张数据中心级GPU协同工作,而现在只靠几台桌面电脑就能触及类似量级的性能了。

一个圆圈中的点代表一台Mac Studio,通过RDMA实线连接成四台组成的网格节点,这个集群被包含在虚线椭圆标注的"数据中心级"区域内。这展示了四台Mac组成的集群带宽已经达到数据中心级GPU的水准。

苹果于8月25日同时发布了新款Mac Studio和Mac mini。Mac Studio搭载了M5 Max与全新打造的M5 Ultra,Mac mini则搭载了苹果首款2纳米芯片M6以及M5 Pro。两款产品今天起开放预订,实际发货将从9月22日开始。

이미지: apple.com
이미지: apple.com

Mac Studio瞄准本地运行的大语言模型,主打M5 Ultra

Mac Studio是苹果面向本地运行大语言模型打造的旗舰桌面电脑。搭载M5 Max的基础版配备18核CPU、最多40核GPU,以及最高128GB统一内存,苹果表示由于在每个GPU核心中嵌入了神经加速器,AI运算性能相比上一代提升最多3.9倍。

高配版本M5 Ultra首次采用了四芯片拼接的四芯设计。CPU最多36核,GPU最多80核,统一内存扩展到最高512GB,内存带宽达到1.2TB/s,比上一代提升50%。苹果表示,这款芯片的AI运算性能相比M3 Ultra提升4.3倍,相比三代前的M1 Ultra则提升了9.8倍。

이미지: apple.com
이미지: apple.com

Mac mini M6、M5 Pro公开LM Studio跑分

Mac mini方面的变化,在TestingCatalog引用的苹果发布内容中有具体数据呈现。M6是苹果首款2纳米制程芯片,配备12核CPU、12核GPU,以及双组16核神经网络引擎。据悉,在LM Studio上运行大语言模型提示词处理速度,相比搭载M1的机型提升13.5倍,相比上一代M4则提升4.8倍。

Pro级别的M5 Pro最多配备18核CPU、20核GPU,最高支持64GB统一内存。同样以LM Studio为基准,提示词处理速度相比M2 Pro提升8.5倍,相比M4 Pro提升4倍。

项目Mac Studio M5 MaxMac Studio M5 UltraMac mini M6Mac mini M5 Pro
CPU18核最多36核12核最多18核
GPU最多40核最多80核12核最多20核
统一内存最高128GB最高512GB16GB(最高32GB)最高64GB
内存带宽614GB/s1.2TB/s最高170GB/s307GB/s
이미지: apple.com

四台组网,达到数据中心级带宽

两款产品均支持Thunderbolt 5和RDMA(远程直接内存访问),可以将多台设备连接成一个统一的内存池。苹果表示,将四台Mac Studio组成集群后,AI推理速度比单机最高提升3倍。

协助苹果打磨这项集群技术的公司是EXO Labs。据EXO Labs在X上发布的帖子,过去一年里他们与苹果合作,在Thunderbolt 5之上开发低延迟的RDMA网络技术,最终实现了将多台Mac组网运行Kimi K3、GLM-5.3等大模型,速度可达到接近API调用的水平。Kimi K3是Moonshot AI开发的开源模型,GLM-5系列则出自Zhipu AI。

通过RDMA组网的Mac,其内存带宽几乎呈线性增长。EXO Labs表示,将四台搭载M5 Ultra的Mac Studio组成集群后,整体带宽可达约4.8TB/s。该公司指出,这样的速度过去只有数据中心级GPU才能实现。

이미지: apple.com

软件生态与macOS 27

苹果此次还推出了名为Core AI的新框架,针对苹果芯片的统一内存、CPU、GPU和神经网络引擎进行优化,让开发者能够在本地完整部署大语言模型,或将自研模型嵌入到应用中。苹果表示,再配合其开源机器学习框架MLX,开发者可以在一台Mac上完成模型的训练、微调直至部署的全过程。

苹果公开的图片资料中展示了几个应用场景:用LM Studio Bionic运行本地大语言模型、用Draw Things生成图像,以及用exo将多台工作站组网连接。这两款产品将随即将推出的macOS 27"Golden Gate"一同发布,其中包含了能够识别屏幕内容、跨应用代为处理任务的新版Siri AI。

Liquid AI在8月12日发布的轻量级视觉语言模型LFM2.5-VL-3B,曾表示在苹果M5 Max上实现了每秒228个token的解码速度。而此次Mac Studio、Mac mini的发布,重点正是将这种本地设备运行模型的速度,扩展到更大的模型以及更多台设备上。

이미지: apple.com

编辑视角

苹果这次真正卖的不是芯片,而是"不依赖云端也能运行大模型"这个承诺。OpenAIAnthropic把模型作为API出售,而苹果卖的是运行这些模型的机器。不按token计费、不把数据传出公司,也能用上大模型——这也正是苹果反复强调的重点。

与上一代相比,这种进步感受得很明显。M3 Ultra时代,光是让一台Mac加载一个大型开源模型都算是挑战,而这一次,统一内存达到512GB,四台组网后带宽更是能达到4.8TB/s。对于亲自在本地以实用速度运行过百亿参数以上模型的人来说,这个数字意味着什么应该一目了然——过去要达到这样的带宽,需要一整个机架的服务器级GPU才行。

在国内,值得关注这一趋势的是那些希望在企业内部自行运行开源模型的团队。过去要在企业内部部署Kimi K3、GLM-5这类大型开源模型而不依赖云端API,需要配备多张NVIDIA GPU的服务器,而苹果给出的答案则是用几根线把几台Mac连接起来。不过需要说明的是,这仅限于推理环节,也就是运行已经训练好的模型,并不意味着从零开始训练模型这件事也能靠Mac集群来替代。

未来几周内,exo、LM Studio等本地AI工具很可能会推出针对M5 Ultra、M6芯片优化的版本。预计也会陆续出现实际用户验证集群配置效果的评测文章。

이미지: apple.com

评论