
图片:由 METAL AI 生成
摘要
- OpenAI首席财务官Sarah Friar在9月8日的博客文章中表示,将在年内部署自研推理芯片"Halapeno"
- 她透露,在InferenceX测试中,该芯片每瓦处理的token数量比商用系统高1.5到1.9倍,延迟则低1.7到3.6倍
- 她表示,凭借10亿周活跃用户和250万企业客户,OpenAI已形成消费者营收与企业营收相互推动的结构
OpenAI首席财务官Sarah Friar在9月8日发布于公司博客的文章中表示,自研推理芯片"Halapeno"将在年内正式投入实际部署。她在文中阐述,来自消费者和企业两端的营收相互拉动、再反哺算力与研发投入,是OpenAI增长战略的核心逻辑,而这篇文章首次公开的芯片性能数据,正是支撑这一说法的依据。
这篇文章并非新模型发布,而是发布在"公司"栏目下的战略性文章。Friar在8月也曾多次撰文谈及算力战略与财务结构,此次文末同样附上了此前文章的列表。这说明这篇文章并非一次性发布,而是OpenAI反复向投资者与合作伙伴讲述的叙事的延续。
具体来看,OpenAI在9月3日发布了新模型GPT-6 Astra,而就在两天前,这也是OpenAI按自身标准首次将某个模型的网络安全风险评为"致命"级别的案例。此外,OpenAI研究团队此前已公布过数据,称目前每一天人类劳动量对应3.1天的智能体劳动量。这篇文章再次引用了这两条消息,并加入自研推理芯片Halapeno的内容,说明OpenAI如何同时管理营收与成本。
先看Friar给出的规模数据:ChatGPT、ChatGPT Work与Codex加在一起,周活跃用户已超过10亿,企业客户达到250万家。据其内部研究,个人用户在注册满6个月时的日均消息量,比使用第一个月时增长了约50%,尝试过的任务种类也增加了约一倍。这一增长背后的逻辑是:先通过广告支持的免费使用,让用户初步体会到AI的实用价值,再通过订阅与按用量计费的方案,逐步提高用户支出。
成本方面的数据同样公布了出来。GPT-5.6 Sol被用于改进生产环境的服务软件后,端到端的服务成本降低了20%,进一步的优化又将token生成效率提升了15%以上。这意味着同样的算力可以产出更多结果,而这种软件层面的成本节约,与硬件层面的成本节约相互结合,正好引出了这篇文章的核心消息——Halapeno芯片。
Halapeno是OpenAI首款自研定制推理芯片。在InferenceX测试中,运行了三款公开模型的结果显示,在按额定功率归一化后,该芯片每瓦最大token处理量比商用系统高1.5到1.9倍,端到端延迟则低1.7到3.6倍。OpenAI表示,计划在年底前将该芯片与NVIDIA、AMD等其他合作伙伴的加速器并行部署,也就是说,即便推出自研芯片,也不会完全取代现有供应商,而是双轨并行。
Friar在发布于OpenAI博客的文章中写道:"更好的模型能开启新的工作可能。"她接着阐述了这样一个循环结构:算力效率的提升让这些工作能够在更大规模上完成,而由此增加的营收又反过来支撑下一步的研究与基础设施建设。她还补充说,在判断投资时,会同时考量每笔投资将满足的需求、该投资转化为实际产出的速度,以及投入资本是否获得了相应回报——这似乎是在提前回应市场对大规模数据中心投资的疑虑。
这一表态发布的时间点也值得留意。上个月,OpenAI与Anthropic为应对中国AI竞争对手的追赶而下调了价格,其中OpenAI将GPT-5.6 Luna的输入和输出token价格均下调了80%。降价的同时要维持盈利能力,就必须真正压低服务成本,而这篇文章所强调的20%成本节约与Halapeno芯片性能,正是给出的答案。国内方面,三星SDS也宣布成为韩国首家加入OpenAI Daybreak项目的企业,与OpenAI的企业合作正在增多。随着OpenAI压低算力成本,这类企业服务的价格竞争力也可能随之变化。
需要指出的是,这篇文章给出的数字目前仍只是OpenAI自行披露的内部指标。Halapeno实际部署后的表现能否与InferenceX测试结果一致,服务成本20%的节约能在多大程度上转化为价格下调,都要等下一季度的业绩与定价政策才能见分晓。归根结底,"消费者与企业相互成就"这一叙事真正的检验标准,不在于亮眼的基准测试数据,而在于OpenAI是否真的把降下来的成本让利给了客户。





评论