每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

GPT-5.6智能体将文档处理成本降至十八分之一

从Hypha AI、Rogo AI案例看代币节省策略,Sol在ARC-AGI-3上得分提升3倍

AI 코딩 모델들의 비용 대비 성능을 비교한 산점도 그래프

이미지: X — 프론티어랩 화면 갈무리

摘要

  • 房地产初创企业Hypha AI使用GPT-5.6 Luna,在保持98%文档提取准确率的同时将成本降至十八分之一
  • 金融研究初创企业Rogo AI通过程序化工具调用将输入代币减少21%,同时保持评估质量
  • GPT-5.6 Sol将ARC-AGI-3得分从13.3%提升至38.3%,输出代币使用量却降至约六分之一
하이파AI 정확도
GPT-5.5 대비 98% 유지 (GPT-5.6 Luna)
하이파AI 비용
기존 대비 18분의 1
로고AI 토큰 절감
입력 토큰 21% 감소, 평가 품질 동일
GPT-5.6 Sol ARC-AGI-3 점수
13.3% → 38.3%
GPT-5.6 Sol 출력 토큰
약 6분의 1로 감소
GPT-5.6 Luna 가격(배경)
100만 토큰당 입력 0.20달러 · 출력 1.20달러 (80% 인하)
GPT-5.6 Sol 가격(배경)
100만 토큰당 입력 5달러 · 출력 30달러

文档处理成本降至十八分之一

OpenAI开发者账号公开的案例显示,房地产初创企业Hypha AI在合同、公示资料等文档信息提取工作中引入了GPT-5.6 Luna。结果显示,与上一代模型GPT-5.5相比,准确率维持在98%的同时,成本降至约十八分之一。文档提取是一项准确率稍有下降就会导致后续工作出现连锁错误的任务,而此次案例的亮点在于几乎没有牺牲准确率的情况下大幅降低了成本。

金融研究:代币减少21%,质量不变

金融研究初创企业Rogo AI在获取并分析公示资料的工作中,采用了程序化工具调用方式——即AI通过代码直接调用所需工具并获取结果的方式。通过这种方式,在保持评估质量不变的前提下,将输入代币使用量减少了21%。这是一个未更换模型、仅通过优化工具调用方式便降低成本的案例。

GPT-5.6 Sol:在保持推理能力的同时实现压缩

OpenAI在自有基准测试中也确认了类似结果。ARC-AGI-3并非测试模型重复已学模式的能力,而是衡量模型解决从未见过的问题的能力,是LLM普遍表现较弱的领域。GPT-5.6 Sol应用了"保留推理(retained reasoning)"和"压缩(compaction)"技术,将该测试得分从13.3%提升至38.3%。据OpenAI介绍,在得分提升近三倍的同时,输出代币使用量反而降至约六分之一。通常提高得分需要消耗更多代币,而此次结果却朝着相反方向发展。

性价比现状如何

OpenAI同时展示了独立分析机构Artificial Analysis的编程指数图表。Artificial Analysis是一家通过测评模型的性能、速度和价格来进行排名的评级机构,本身并不开发模型。以下整理了图表中显示的上位区间情况(基于图表位置的近似值)。

模型API成本(估算)指数得分(估算)
GPT-5.6 Sol~$2,400~80.1
Claude Fable 5~$3,700~77.2
GPT-5.6 Luna~$550~77.5
GPT-5.5~$1,700~76.5
GPT-5.6 Terra~$550~73
Claude Opus 4.8~$2,400~72.7
Gemini 3.1 Pro Preview~$650~42.7

在相同成本区间(~$2,400)内,GPT-5.6 Sol得分高于Claude Opus 4.8;而GPT-5.6 Luna则以远低于Terra的成本,取得了相近甚至更高的得分。这意味着在Luna、Terra、Sol三个等级中选择哪款模型,同等预算下所能获得的性能差异相当大。

发布背景:价格战正在进行中

此次案例是近期持续数日的价格竞争的延续。据8月14日报道,OpenAI将GPT-5.6 Luna的输入、输出代币价格均下调80%,降至每百万代币输入0.20美元、输出1.20美元。Anthropic也以其顶级模型Fable 5一半的价格推出了Opus 5,面对Moonshot、DeepSeek等中国模型的追赶,降价趋势仍在持续。此次发布更像是展示这种降价策略在实际应用中如何发挥作用的案例。与降低模型本身价格同样重要的是,为不同任务选择何种等级的模型、如何设计工具调用方式,这些因素对实际账单的影响更大——这是此次案例的共同点。

编辑观察

此次发布真正值得关注的,并非数字本身,而是OpenAI选择案例的方式。将宣传重点放在"更便宜地完成同样工作"而非"更聪明的模型"上,这本身就是一个信号,表明当前竞争的重心已从智能得分转向单位成本。结合8月12日的报道——Grok 4.6在价格不变的情况下获得了与GPT-5.6 Sol同等的智力指数得分,以及DeepSeek 4 Pro定价更低的消息,这幅图景就变得更加清晰了。现在的较量不再是谁能实现最高性能,而是谁能以更低价格实现相同性能。

从代际对比来看,这种变化感受更为明显。去年为止,为智能体接入模型的基本做法还是"选定一个最聪明的模型用于所有任务"。而现在,文档提取用便宜等级、复杂推理用昂贵等级,即便在同一等级内部,仅通过优化工具调用设计来减少代币消耗,已经成为业内常识。只接入单一模型草草了事的团队,与按任务划分等级、精细打磨工具调用的团队之间的成本差异,已经不再是倍数级别,而是数量级的差距。

对于国内初创企业而言,现在需要检查的只有一件事——先确认目前使用的智能体是否在所有任务上都套用了同一等级的模型。如果在简单的提取、分类任务中仍在使用顶级模型,那么降级到Luna级别,准确率损失很可能只在个位数百分比范围内。反之,若在需要复杂推理的任务中强行套用便宜模型,同样得不偿失。等级划分实验完全可以现在就着手进行,而且比起修改单条提示词,调整模型等级配置带来的成本节省效果要大得多。

未来数周,这种"成本案例公开"不会只是OpenAI一家的做法。Anthropic和xAI很可能也会打出类似的客户案例来延续价格竞争,而下一轮较量的焦点将不再是模型价格表本身,而是谁能率先把等级设计和工具调用优化的经验系统化、文档化。