每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

同一AI模型速度因服务器差异最高相差15倍,为何如此

Artificial Analysis将于8月12日在旧金山举办活动,探讨推理服务商之间的速度差距

이미지: METAL LAB 생성

摘要

  • 基准测试公司Artificial Analysis披露,同一模型的输出速度因服务商不同最高可相差15倍
  • 该公司将于8月12日在旧金山与相关推理服务商共同举办活动,探讨背后原因
  • 速度差距据悉源于硬件、批处理策略、量化方式等服务方式上的差异
발표 주체
Artificial Analysis
발표 채널
X(트위터) 게시물, 2026-08-10
핵심 주장
동일 모델 기준 프로바이더별 출력 속도 최대 15배 이상 차이
행사 일시
2026년 8월 12일 수요일
행사 장소
샌프란시스코
참가자
Artificial Analysis 및 주요 추론 프로바이더(구체 명단 미공개)

同一模型,不同速度

开发者如果选定一个开源大语言模型,在多个云平台上运行,很快就会发现响应速度参差不齐。AI基准测试公司Artificial Analysis在8月10日发布的一篇文章中指出,即便是同一个模型,根据提供该服务的推理服务商不同,输出速度可能相差15倍以上。也就是说,尽管使用的是同一个模型文件,但在某些平台上转眼间就能得到答案,而在另一些平台上却要等待很久。

Artificial Analysis表示:"即便是同一模型,根据推理服务商的不同,输出速度也可能相差15倍以上。"据了解,该公司是一家独立研究机构,定期比较并公开OpenAI、谷歌DeepMind等主要实验室模型,以及提供开源模型服务的云服务商和基础设施企业的速度、价格和质量。

8月12日在旧金山举办的活动

Artificial Analysis表示,将于8月12日星期三在旧金山举办活动,探讨这一差距的成因及其在实际业务中的意义。该公司预告称,除自身外还将有多家推理服务商共同参与此次活动,但本次文章中并未公开具体的参与企业名单。

速度差距为何如此悬殊

即便是同一模型,实际服务方式也可能截然不同。推理(inference)指的是将问题输入已完成训练的模型并提取答案的过程,而这一阶段的速度更多取决于运行该模型的基础设施设计,而非模型本身。

因素说明
硬件类型通用GPU与推理专用芯片(如LPU、晶圆级芯片)在处理同一模型时速度不同
批处理(batching)策略将多个请求打包一起处理可提高吞吐量,但单个响应可能变慢
量化程度模型精度越低速度越快,但会与质量产生权衡
网络与地区用户与服务器之间的距离及网络状况也会影响实际感知的延迟
服务软件根据vLLM等推理引擎的优化程度不同,即便使用相同GPU吞吐量也会有差异

这些因素叠加在一起,导致同一模型在不同服务商之间,每秒生成的token数量(模型每秒生成的词语片段数量,是衡量响应速度的基本单位)出现巨大差距。

推理市场的竞争格局

随着开源模型的增多,模型本身已经成为任何人都能下载的东西。相反,竞争的重心已转移到"谁能更快、更便宜地提供这个模型的服务"上。据悉,Groq凭借自主研发的专用芯片主打速度,Cerebras则通过将整片晶圆用作单个芯片的方式来提升吞吐量。据了解,Together AI、Fireworks AI等公司则在GPU云端优化服务引擎,采取兼顾速度与成本平衡的策略。Artificial Analysis此次举办的活动,也被解读为试图梳理并呈现这场基础设施竞争的一次尝试。

由此带来的变化

本次发布的核心在于,与选择哪个模型同样重要的是,在哪里运行这个模型也会决定实际服务质量。这意味着,对于开发聊天机器人或编程智能体的开发者来说,即便是同一个开源模型,查看不同服务商之间的速度和价格对比表已成为必不可少的步骤。在模型性能竞争已趋于均衡的当下,下一个战场终究会转向"谁能以更快、更低的成本运行该模型"的基础设施之争。