
이미지: apple.com
摘要
- 苹果发布了搭载M5 Max、M5 Ultra的新款Mac Studio,以及搭载M6、M5 Pro的新款Mac mini
- 借助Thunderbolt 5和RDMA技术,多台设备可以组网连接,EXO Labs表示四台Mac Studio组成的集群带宽可达约4.8TB/s
- 两款产品今天起开放预订,9月22日开始发货
- Mac Studio 탑재 칩
- M5 Max, M5 Ultra
- Mac Studio 최대 사양
- GPU 80코어, 통합메모리 512GB, 대역폭 1.2TB/s
- Mac mini 탑재 칩
- M6(애플 첫 2나노 칩), M5 Pro
- Mac mini M6 LLM 처리속도(LM Studio)
- M1 대비 13.5배, M4 대비 4.8배
- Mac mini M5 Pro LLM 처리속도(LM Studio)
- M2 Pro 대비 8.5배, M4 Pro 대비 4배
- 4대 클러스터 AI 추론 속도(애플 발표)
- 단일 시스템 대비 최대 3배
- 4대 M5 Ultra 클러스터 통합 대역폭(EXO Labs)
- 약 4.8TB/s
- 사전주문·출시일
- 8월 25일 사전주문 시작, 9월 22일 배송 시작
苹果表示,四台Mac Studio组网后,内存带宽可达每秒4.8太字节。过去要达到这样的速度,需要多张数据中心级GPU协同工作,而现在只靠几台桌面电脑就能触及类似量级的性能了。
苹果于8月25日同时发布了新款Mac Studio和Mac mini。Mac Studio搭载了M5 Max与全新打造的M5 Ultra,Mac mini则搭载了苹果首款2纳米芯片M6以及M5 Pro。两款产品今天起开放预订,实际发货将从9月22日开始。


Mac Studio瞄准本地运行的大语言模型,主打M5 Ultra
Mac Studio是苹果面向本地运行大语言模型打造的旗舰桌面电脑。搭载M5 Max的基础版配备18核CPU、最多40核GPU,以及最高128GB统一内存,苹果表示由于在每个GPU核心中嵌入了神经加速器,AI运算性能相比上一代提升最多3.9倍。
高配版本M5 Ultra首次采用了四芯片拼接的四芯设计。CPU最多36核,GPU最多80核,统一内存扩展到最高512GB,内存带宽达到1.2TB/s,比上一代提升50%。苹果表示,这款芯片的AI运算性能相比M3 Ultra提升4.3倍,相比三代前的M1 Ultra则提升了9.8倍。


Mac mini M6、M5 Pro公开LM Studio跑分
Mac mini方面的变化,在TestingCatalog引用的苹果发布内容中有具体数据呈现。M6是苹果首款2纳米制程芯片,配备12核CPU、12核GPU,以及双组16核神经网络引擎。据悉,在LM Studio上运行大语言模型提示词处理速度,相比搭载M1的机型提升13.5倍,相比上一代M4则提升4.8倍。
Pro级别的M5 Pro最多配备18核CPU、20核GPU,最高支持64GB统一内存。同样以LM Studio为基准,提示词处理速度相比M2 Pro提升8.5倍,相比M4 Pro提升4倍。
| 项目 | Mac Studio M5 Max | Mac Studio M5 Ultra | Mac mini M6 | Mac mini M5 Pro |
|---|---|---|---|---|
| CPU | 18核 | 最多36核 | 12核 | 最多18核 |
| GPU | 最多40核 | 最多80核 | 12核 | 最多20核 |
| 统一内存 | 最高128GB | 最高512GB | 16GB(最高32GB) | 最高64GB |
| 内存带宽 | 614GB/s | 1.2TB/s | 最高170GB/s | 307GB/s |

四台组网,达到数据中心级带宽
两款产品均支持Thunderbolt 5和RDMA(远程直接内存访问),可以将多台设备连接成一个统一的内存池。苹果表示,将四台Mac Studio组成集群后,AI推理速度比单机最高提升3倍。
协助苹果打磨这项集群技术的公司是EXO Labs。据EXO Labs在X上发布的帖子,过去一年里他们与苹果合作,在Thunderbolt 5之上开发低延迟的RDMA网络技术,最终实现了将多台Mac组网运行Kimi K3、GLM-5.3等大模型,速度可达到接近API调用的水平。Kimi K3是Moonshot AI开发的开源模型,GLM-5系列则出自Zhipu AI。
通过RDMA组网的Mac,其内存带宽几乎呈线性增长。EXO Labs表示,将四台搭载M5 Ultra的Mac Studio组成集群后,整体带宽可达约4.8TB/s。该公司指出,这样的速度过去只有数据中心级GPU才能实现。

软件生态与macOS 27
苹果此次还推出了名为Core AI的新框架,针对苹果芯片的统一内存、CPU、GPU和神经网络引擎进行优化,让开发者能够在本地完整部署大语言模型,或将自研模型嵌入到应用中。苹果表示,再配合其开源机器学习框架MLX,开发者可以在一台Mac上完成模型的训练、微调直至部署的全过程。
苹果公开的图片资料中展示了几个应用场景:用LM Studio Bionic运行本地大语言模型、用Draw Things生成图像,以及用exo将多台工作站组网连接。这两款产品将随即将推出的macOS 27"Golden Gate"一同发布,其中包含了能够识别屏幕内容、跨应用代为处理任务的新版Siri AI。
Liquid AI在8月12日发布的轻量级视觉语言模型LFM2.5-VL-3B,曾表示在苹果M5 Max上实现了每秒228个token的解码速度。而此次Mac Studio、Mac mini的发布,重点正是将这种本地设备运行模型的速度,扩展到更大的模型以及更多台设备上。

编辑视角
苹果这次真正卖的不是芯片,而是"不依赖云端也能运行大模型"这个承诺。OpenAI和Anthropic把模型作为API出售,而苹果卖的是运行这些模型的机器。不按token计费、不把数据传出公司,也能用上大模型——这也正是苹果反复强调的重点。
与上一代相比,这种进步感受得很明显。M3 Ultra时代,光是让一台Mac加载一个大型开源模型都算是挑战,而这一次,统一内存达到512GB,四台组网后带宽更是能达到4.8TB/s。对于亲自在本地以实用速度运行过百亿参数以上模型的人来说,这个数字意味着什么应该一目了然——过去要达到这样的带宽,需要一整个机架的服务器级GPU才行。
在国内,值得关注这一趋势的是那些希望在企业内部自行运行开源模型的团队。过去要在企业内部部署Kimi K3、GLM-5这类大型开源模型而不依赖云端API,需要配备多张NVIDIA GPU的服务器,而苹果给出的答案则是用几根线把几台Mac连接起来。不过需要说明的是,这仅限于推理环节,也就是运行已经训练好的模型,并不意味着从零开始训练模型这件事也能靠Mac集群来替代。
未来几周内,exo、LM Studio等本地AI工具很可能会推出针对M5 Ultra、M6芯片优化的版本。预计也会陆续出现实际用户验证集群配置效果的评测文章。





评论