
이미지: Hacker News (200↑)
摘要
- Cerebras发布新一代AI推理硬件CS-4,称其推理速度比GPU系统最高快30倍。
- 将晶圆间通信延迟降至2微秒,即使在参数量超过10万亿的模型上也能维持每秒1000个token以上的生成速度。
- 采用电源、散热与运算分离的模块化结构,将部署时间从数天缩短至数小时。
- 추론 속도
- GPU 시스템 대비 최대 30배
- 전력 효율
- CS-3 대비 와트당 처리량 최대 10배
- 웨이퍼 간 지연시간
- 2마이크로초
- 생성 속도
- 10조 매개변수 이상 모델에서 초당 1,000토큰 이상
- 전력 공급 거리
- 프로세서에서 0.5mm (기존 GPU 보드 약 50mm 대비 약 100배 근접)
- 배포 시간
- 며칠에서 몇 시간으로 단축
- 부품 수
- 웨이퍼 스케일 백팩 기준 50% 감소
发生了什么变化
Cerebras发布了新一代推理硬件CS-4。该公司公布的核心数据只有一个:与GPU系统相比,推理速度最高提升30倍。支撑这一性能的是新一代处理器WSE-Turbo,单晶圆性能相比上一代也提升了2倍。
Cerebras一直采用的方式,不是将多张GPU拼接起来,而是把整个AI模型放到一整块巨大的硅晶圆上。正如8月6日《Lovable与Cerebras达成AI响应速度基础设施合作》一文所述,这种晶圆级引擎(Wafer-Scale Engine)通过消除芯片之间的通信开销本身来降低延迟。CS-4正是这一思路进一步推进的产物。

10万亿参数级模型也能实时运行
据Cerebras介绍,CS-4将晶圆与晶圆之间的通信延迟降至2微秒。公司表示,得益于此,即便在参数量超过10万亿的超大型模型上,也能实现每秒1000个token以上的生成速度,维持对话式的响应速度。在相同条件下,单位功耗处理量比上一代CS-3最高提升了10倍。也就是说,速度和能效同时得到了提升。

Nexus平台架构与晶圆级背包
CS-4是Cerebras新推出的"Nexus平台架构"的首款产品。其特点是将运算(Compute)、电源(Power)、输入输出(I/O)分离为独立模块。其中,"晶圆级背包(Wafer-Scale Backpack)"将晶圆本体、电源转换、直接液冷、高速I/O以及控制电子设备压缩进一个3D封装体,公司表示零部件数量比之前减少了50%。
供电距离也大幅缩短。处理器到电源之间的距离仅为0.5毫米,比现有GPU板卡约50毫米的距离近了100倍。Cerebras表示,这一结构几乎消除了板级电力损耗,使供给WSE-Turbo的电力量提升了一倍,从而实现更高的工作频率和更快的token生成速度。新的I/O子系统将带宽提升了一倍并降低了延迟,此外还推出了无需额外交换机、可在机柜内部及机柜之间连接晶圆的"晶圆I/O模块"。

与CS-3相比有何不同
| 项目 | CS-3 | CS-4 |
|---|---|---|
| 单晶圆性能 | 基准 | 最高提升2倍 |
| 单位功耗处理量 | 基准 | 最高提升10倍 |
| 晶圆间延迟 | 相对较高 | 2微秒 |
| 电源-处理器间距 | 与现有GPU板卡相当 | 0.5mm |
| 部署时间 | 相对较长 | 数天→数小时 |
Cerebras表示,包含电源、散热与网络层的"电源机柜(PowerRack)"可以在运算模块到货之前预先安装并完成现场认证。之后只需将运算用背包插入机柜即可,由此将部署时间从数天缩短至数小时。
实际应用场景在哪里
Cerebras的晶圆级引擎已经用于实际服务。Vibe编程初创公司Lovable上月宣布与Cerebras达成合作,正将对延迟敏感的编程智能体工作负载首先迁移到该基础设施上。同期,Lovable在8个月内将估值翻倍至133亿美元。CS-4所宣称的每秒1000个token以上的生成速度,很可能会在这类实时编程智能体或对话式服务中,带来响应延迟上可感知的改善。不过,CS-4具体何时投入实际云服务、具体使用条件如何,此次发布中并未明确。
编辑视角
当下AI推理基础设施的竞争分成两条路线:一条是像NVIDIA那样大规模拼接通用GPU来扩展,另一条是像Cerebras那样把整个模型放到一整块超大晶圆上,从根本上消除芯片间通信开销。CS-4所强调的那些数字——2微秒延迟、0.5毫米供电距离——归根结底是把后一种逻辑推向了极致。这份发布用数字证明了一点:当参数量超过10万亿的模型需要实时运行时,芯片与芯片之间的物理距离本身就会成为瓶颈。
与上一代CS-3相比,这次发布中真正值得关注的,与其说是速度数字,不如说是"组装方式"。将晶圆、电源、散热压缩为一体的背包结构、零部件数量减少50%、部署时间从数天缩短至数小时,这一组合意味着这家公司如今不仅在比拼芯片性能,更把"能多快实际部署进数据中心"当作新的竞争维度。做过超大规模基础设施的团队都清楚,实际瓶颈往往不是芯片性能本身,而是安装和认证所耗费的时间。
对国内企业而言,这次发布眼下真正有意义的对象,是那些能够以云服务形式租用这一基础设施的初创公司。如果像Lovable那样运营对延迟敏感的智能体服务,租用这类专用硬件而非自建GPU集群,已经是一个现实可行的选项。不过,将超大型模型直接部署到自有基础设施,仍是大型云服务商和少数超大规模企业的领地。
未来几周值得关注的是,CS-4究竟何时以何种价格条件通过云端API正式开放。Cerebras能多快将这种速度优势转化为商业化服务,将决定下个季度内GPU推理服务与之在价格和速度上的竞争格局是否会再次发生变化。



