
图片:YouTube(视频截图)
摘要
- Meta在其Newsroom上发布了一段12分06秒的视频,带观众参观门洛帕克基础设施实验室内部。这段实验室参观视频由开发者兼内容创作者Tom Shaw通过与Meta的付费合作制作。
- 视频把装有8块NVIDIA H100芯片的风冷托盘和装有4块GB300芯片的水冷托盘并排放在一起,还展示了下一代原型机架——已通过闭环液冷、连接72颗GPU的铜制背板网络以及运输冲击等测试。
- 这些硬件基于AMD和NVIDIA的芯片打造,但实验室里也有Meta自研芯片的原型机。新机架和自研芯片目前都还没有量产。
Meta在其Newsroom上发布了一段12分06秒的视频,展示了位于加利福尼亚州门洛帕克的基础设施实验室内部。开发者兼内容创作者Tom Shaw通过与Meta的付费合作制作了这段视频,站在实物硬件前讲解运行下一代AI所需的设备是什么样子。Newsroom的文字说明只有一句话,全部内容都在视频里。METAL查阅了完整视频后发现,这间实验室展示的重点不是某一块芯片的性能,而是每换一代芯片,散热、网络和机架结构就必须整体重新设计这一事实。
视频开头,Tom Shaw说:"在AI领域,大小不重要,效率才重要。"他说,很多人以为把新模型的能力翻倍,只要把硬件数量翻倍就行,但他到了这间实验室才明白事实并非如此。他解释说,处理Instagram照片点赞请求的硬件,和训练、运行AI模型推理的硬件完全是两回事,这也是为什么专为AI打造的数据中心基础设施和传统数据中心不一样。
他打的比方是攒电脑。先定好需求,再从各个渠道买零件——AI公司走的是同一套流程,但到了一定规模之后,自己设计硬件比买现成的更高效。视频里解释说,同样一间能塞下1000块GPU现成服务器的房间,换成自研硬件后,能在相同空间里装进两倍的算力,原因不仅是系统更紧凑,每块芯片本身也更强大。
实物对比是这段视频的核心。Tom Shaw先展示的托盘里装着8块NVIDIA H100芯片,紧挨着的托盘里装着4块NVIDIA GB300芯片。他说不会详细比较这两款芯片,但表示4块GB300的性能超过8块H100。GB300体积小得多,一个机架能塞下更多芯片,单块芯片性能又更强,一个机架能装的算力因此大幅提升。但这块GB300没法直接塞进H100的托盘里,最大的原因是散热。
H100的托盘是风冷,GB300的托盘是水冷。视频中一位未透露姓名的Meta硬件工程团队工程师解释说,冷却液流经托盘内的冷板,给接触冷板的芯片降温,冷却液在托盘、冷板和机架之间形成闭环循环,再通过数据中心内部的热交换把热量排到外面。他补充说,如今的GPU发热量太大,到了某个临界点,单靠空气散热不只是效率变差,而是根本行不通。根据Tom Shaw今年8月在Meta Newsroom上撰写的散热解读文章,这种冷却液是水和乙二醇的混合物,最长可以十年不用更换,没有液冷设施的建筑则采用把水泵和热交换器装进机架的风辅助液冷方案。他在那篇文章里写道:"采用闭环液冷和干式冷却器的典型AI数据中心,一年的用水量比几家全服务餐厅还少。"那篇文章还提到,用空气给同样的服务器散热,服务器托盘的尺寸几乎要翻倍,而直接接触芯片的液冷方案能让同一个机架塞进更多GPU。
散热之后是网络。新芯片每秒处理的数据更多,但现有网络设备撑不住这个吞吐量。视频里的机架装有72块GPU,而此前数据中心视频里连接16块H100的方式,在这个规模下已经行不通了。据这位工程师介绍,72块GPU由机架内部的中央交换网络连接,机架背后的铜缆背板则在一个72芯片的纵向扩展域内组成GPU网状网络。在此之上还有一层横向扩展互联,把多个机架连接到同一栋建筑,乃至跨越多栋建筑。他说训练任务不是管理者把工作分给机架、机架再分给托盘这么简单的画面,更接近把任务打散到72块GPU甚至更大规模集群上的"有组织的混乱"。他说创新的关键不在于网络的堆量,而在于用低延迟做到这一点,并表示"把所有环节整合到一起才是真正的难题"。也就是说,即便买来性能强劲的芯片并部署到位,如果训练过程中没有网络在芯片之间搬运数据,这些芯片也发挥不出应有的作用。
创新永不停歇这句话在这段视频里是字面意思。装有72块GB300的机架今年早些时候刚部署,Meta已经在做下一代原型了。视频没有给出规格或部署时间表,但公司表示量产还没准备好,不过已经很接近了。新机架比之前大不少,工程师们在结构验证上下了不少功夫:要确认它能不能扛住卡车运输中的冲击和振动周期,背部接口能不能牢固对接。机架一旦下垂或对不齐,就会产生干扰、影响可靠性,尤其是在维护计算托盘或网络托盘的时候更麻烦。回到攒电脑的比方,这不是换个最新零件那么简单,而是根据需求把机箱本身重新设计一遍,有时候连外形规格都要改。
用这种方式造出来的机架部署量是数十万台级别。公司表示,硬件工程的目标是把在工厂里完全集成好的系统,以良好状态送到数据中心。理想情况是:从板条箱里卸下机架,用专用物料搬运设备运到数据中心的机列里,接上几根线、通电,第一次启动就能成功配置,直接成为机群的一部分。方向是尽量减少在数据中心现场需要动手处理的工作,就像家电一样,拆开包装箱就能立刻使用。
视频里展示的硬件创新全都建立在AMD和NVIDIA制造的芯片之上,但实验室的一角也摆着Meta自主设计的自研芯片原型。Tom Shaw解释说,在这个规模下需要非常量身定制的方案,他也明确表示这款芯片同样还是尚未准备好量产的原型。METAL此前报道过Waymo为旗下机器人出租车自研芯片、以减少对NVIDIA依赖的举动,如今规模做大的公司连散热、机架到芯片都要亲自设计,这股潮流在Meta身上也在朝同一个方向发展。
散热方式的选择直接决定了用水量。根据Tom Shaw今年8月的散热解读文章,Meta在一家数据中心的试点中用强化学习把风冷供风扇的能耗平均降低了20%,用水量降低了4%,并把这套方法推广到了更多风冷数据中心。2025年,Meta还通过开放计算项目开源了液冷网络机架平台Icepack。METAL此前报道过科技公司高管在G20会场外面对抗议、抗议者不满数据中心耗费的水电资源这一事件,而这段视频里"选择哪种散热方式决定用水量"的说法,恰好正处在那场争论的核心。
这间实验室说明的AI基础设施真正的竞争力,不在于买了多少块GPU,而在于每换一代芯片,能多快重新设计散热、网络和机架,并以数十万台的规模从工厂里批量产出。Meta找的答案不是用别人的零件攒一台PC,而是从机箱本身开始重新设计的自研方案。





评论