
이미지: METAL LAB 생성
摘要
- 基准测试公司Artificial Analysis披露,同一模型的输出速度因服务商不同最高可相差15倍
- 该公司将于8月12日在旧金山与相关推理服务商共同举办活动,探讨背后原因
- 速度差距据悉源于硬件、批处理策略、量化方式等服务方式上的差异
- 발표 주체
- Artificial Analysis
- 발표 채널
- X(트위터) 게시물, 2026-08-10
- 핵심 주장
- 동일 모델 기준 프로바이더별 출력 속도 최대 15배 이상 차이
- 행사 일시
- 2026년 8월 12일 수요일
- 행사 장소
- 샌프란시스코
- 참가자
- Artificial Analysis 및 주요 추론 프로바이더(구체 명단 미공개)
同一模型,不同速度
开发者如果选定一个开源大语言模型,在多个云平台上运行,很快就会发现响应速度参差不齐。AI基准测试公司Artificial Analysis在8月10日发布的一篇文章中指出,即便是同一个模型,根据提供该服务的推理服务商不同,输出速度可能相差15倍以上。也就是说,尽管使用的是同一个模型文件,但在某些平台上转眼间就能得到答案,而在另一些平台上却要等待很久。
Artificial Analysis表示:"即便是同一模型,根据推理服务商的不同,输出速度也可能相差15倍以上。"据了解,该公司是一家独立研究机构,定期比较并公开OpenAI、谷歌DeepMind等主要实验室模型,以及提供开源模型服务的云服务商和基础设施企业的速度、价格和质量。
8月12日在旧金山举办的活动
Artificial Analysis表示,将于8月12日星期三在旧金山举办活动,探讨这一差距的成因及其在实际业务中的意义。该公司预告称,除自身外还将有多家推理服务商共同参与此次活动,但本次文章中并未公开具体的参与企业名单。
速度差距为何如此悬殊
即便是同一模型,实际服务方式也可能截然不同。推理(inference)指的是将问题输入已完成训练的模型并提取答案的过程,而这一阶段的速度更多取决于运行该模型的基础设施设计,而非模型本身。
| 因素 | 说明 |
|---|---|
| 硬件类型 | 通用GPU与推理专用芯片(如LPU、晶圆级芯片)在处理同一模型时速度不同 |
| 批处理(batching)策略 | 将多个请求打包一起处理可提高吞吐量,但单个响应可能变慢 |
| 量化程度 | 模型精度越低速度越快,但会与质量产生权衡 |
| 网络与地区 | 用户与服务器之间的距离及网络状况也会影响实际感知的延迟 |
| 服务软件 | 根据vLLM等推理引擎的优化程度不同,即便使用相同GPU吞吐量也会有差异 |
这些因素叠加在一起,导致同一模型在不同服务商之间,每秒生成的token数量(模型每秒生成的词语片段数量,是衡量响应速度的基本单位)出现巨大差距。
推理市场的竞争格局
随着开源模型的增多,模型本身已经成为任何人都能下载的东西。相反,竞争的重心已转移到"谁能更快、更便宜地提供这个模型的服务"上。据悉,Groq凭借自主研发的专用芯片主打速度,Cerebras则通过将整片晶圆用作单个芯片的方式来提升吞吐量。据了解,Together AI、Fireworks AI等公司则在GPU云端优化服务引擎,采取兼顾速度与成本平衡的策略。Artificial Analysis此次举办的活动,也被解读为试图梳理并呈现这场基础设施竞争的一次尝试。
由此带来的变化
本次发布的核心在于,与选择哪个模型同样重要的是,在哪里运行这个模型也会决定实际服务质量。这意味着,对于开发聊天机器人或编程智能体的开发者来说,即便是同一个开源模型,查看不同服务商之间的速度和价格对比表已成为必不可少的步骤。在模型性能竞争已趋于均衡的当下,下一个战场终究会转向"谁能以更快、更低的成本运行该模型"的基础设施之争。



