
摘要
- Anthropic 于 10 月 7 日发布 Claude Haiku 5.5。10 万 token 以内请求的单价比 Haiku 4.5 低 90%,公司测算的平均运行成本下降约 75%。
- 在发布的基准表中,它在 OSWorld 2.1 取得 72.4%、Terminal-Bench 4.0 取得 39.2%、GDPval-AA v2.1 取得 1620,均领先 GPT-6 Luna(48.9%、16.4%、1437)。
- 同日,Anthropic 将 Sonnet 5.5 的缓存读取价格减半,并开始向 Max 和 Team 订阅用户发放每月 API 额度。
Anthropic 于 10 月 7 日发布小型模型 Claude Haiku 5.5。公司称其为"我们迄今发布的最便宜、最快、能力最强的小型模型"。10 万 token 以内请求的 token 单价比上一代 Haiku 4.5 低 90%,Anthropic 测算的平均运行成本下降约 75%。同一天,公司将 Sonnet 5.5 的缓存读取价格减半,并开始每月向 Max 和 Team 订阅用户发放 API 额度。
Haiku 5.5 是继 9 月 22 日的 Opus 5.5、9 月 28 日的 Sonnet 5.5 之后,5.5 代的第三款模型。Anthropic 表示,它面向摘要、压缩(compaction)、数据库查询和分类等大量重复性工作。在编程任务中,公司建议将其用作子代理,承接 Opus 5.5 或 Sonnet 5.5 拆分出来的小任务。公司称,它是标准速度下最快的模型,也适合实时客服和浏览器操作。Anthropic 在脚注中写明,它仍比以 Fast Mode 运行的 Opus 慢。
价格结构按请求长度划分。10 万 token 以内的请求,每百万输入 token 0.10 美元、输出 0.50 美元,比 Haiku 4.5 的 1 美元和 5 美元低 90%。超过 10 万 token 的请求为 0.50 美元和 2.50 美元,降幅仅为 50%。据 Anthropic 称,Haiku 4.5 收到的请求中约 90% 在 10 万 token 以内。公司解释说,75% 这一平均数字也计入了新分词器在同样工作中会多用一些 token 的因素。据报道,低档的输入、输出和缓存单价与 OpenAI 上月推出的低价模型 GPT-6 Luna 完全相同。
基准表直接瞄准同价位的竞争模型。在 METAL 查阅的发布表格中,Haiku 5.5 在衡量真实电脑操作的 OSWorld 2.1 离线子集上取得 72.4%,Haiku 4.5 为 15.7%,GPT-6 Luna 为 48.9%。在衡量命令行代理编程的 Terminal-Bench 4.0 上,它取得 39.2%,领先 Haiku 4.5 的 0.0% 和 GPT-6 Luna 的 16.4%。知识工作评估 GDPval-AA v2.1 得分为 1620,高于 Haiku 4.5 的 735 和 GPT-6 Luna 的 1437。在 Humanity's Last Exam 上,不使用工具为 45.9%,使用工具为 57.4%。
与更大模型的差距依然存在。作为参考列出的 Sonnet 5.5 在 OSWorld 2.1 上为 83.9%,在 Terminal-Bench 4.0 上为 70.6%。Anthropic 明确划线:复杂的代理编程仍以 Sonnet 5.5 和 Opus 5.5 为佳,Haiku 5.5 适合范围较窄的任务。这些数字均由公司自行测得。据报道,Terminal-Bench 39% 左右的分数来自最高努力设置,默认的中等设置约为 20%。

努力设置是这款模型的新调节旋钮。Haiku 5.5 是 Haiku 系列中首个可调节努力程度的模型。用户可以在同一模型上选择节省成本还是提升智能。发布中的 OSWorld 2.1 图表显示,从 Low 到 Max 的五个档位中,分数与每次尝试成本同步上升,且每个档位都位于相近成本的 GPT-6 Luna 曲线之上。
在发布前试用的企业首先提到速度。Asana 资深软件工程师 Aaron Vinh 表示,在 AI Teammates 评估中,与现用模型相比,任务完成延迟降低 30% 以上,每轮代理推理最多快 2.5 倍,并称这是"明显更轻快的体验"。HubSpot 表示,Haiku 5.5 在其 CRM 评估中取得三次平均 92.8% 的分数,是其见过的最高分。文档问答功能每周调用约 800 万次的 AlphaSense 表示,该模型在 400 个查询中得到 0.84 分,较 Haiku 4.5 的 0.76 分有统计显著提升。Box 表示,它以约一半的延迟取得比 Haiku 4.5 高 11 分的成绩。

金融 AI 公司 Rogo 的案例说明了子代理的用法。大模型制作演示文稿时,Haiku 5.5 子代理从 10-K 报告中找出所需的那一行分部营收。Rogo 的 Alex Wang 说:"它准确到足以让我们放心交给它,又快又便宜到可以大量运行。"Cognition 表示,在 Devin Fusion 中以 Opus 5.5 为主模型、Haiku 5.5 为辅助,可在保持 FrontierCode 66.2 分的同时降低成本和延迟。
安全机制也重新设计。Anthropic 表示,该模型在大多数对齐评估中较 Haiku 4.5 显著改善,配合滥用的倾向更低。其网络安全防护比 Haiku 4.5 更严格,但比 Sonnet 5.5 允许更广泛的防御性工作。渗透测试等更可能被攻击者使用的技术仍被拦截。需要更广泛访问权限的机构可以申请生命科学验证计划和网络验证计划。
其余产品线的价格也随之调整。Sonnet 5.5 的缓存读取价格从每百万 token 0.20 美元降至 0.10 美元。由于缓存读取占 token 消耗的很大比例,公司估计大多数代理任务的成本将下降约 20%。从本周起,Max 5x 订阅用户每月获得 100 美元 API 额度,Max 20x 为 200 美元,Team 为用户合计最多 500 美元。Python 和 TypeScript SDK 以测试版形式加入了电脑操作和浏览器操作支持。METAL 曾报道 Anthropic 的 Sonnet 5.5 发布 和 OpenAI 的 GPT-6 Sol 与 Luna 发布。
Haiku 5.5 现已在 Claude 平台以 claude-haiku-5-5 的名称上线,并登陆 AWS、Google Cloud 和 Microsoft Azure。这次发布的分量与其说在于一张基准表,不如说在于价格和分工。在大模型负责判断、小模型无数次运行重复工作的结构中,Anthropic 把调用最频繁的位置的单价压到了与竞争对手低价模型相同的水平。剩下的问题是,当开发者按努力设置和请求长度拆分工作时,实际账单会多接近公司所说的 75%。
信息来源
- Anthropic — Introducing Claude Haiku 5.5 →
- SiliconANGLE — Anthropic releases Claude Haiku 5.5 small model and halves Sonnet 5.5 cache read prices →
- The New Stack — Anthropic launches Haiku 5.5 at a much lower price →
- VentureBeat — Anthropic launches Claude Haiku 5.5 with 90% API price reduction, matching GPT-6 Luna →





评论