METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Anthropic 发布 Claude Opus 5.5

Anthropic 推出了新的 Claude 5.5 系列首款模型。它在多数工作上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%,网络安全类请求则被转交给 Opus 4.8。

Anthropic 发布 Claude Opus 5.5

摘要

  • Anthropic 于 9 月 22 日发布 Claude Opus 5.5,这是新的 Claude 5.5 系列的首款模型。
  • 在覆盖近 2000 个情景的自动行为审计中,它取得了该公司迄今测试过的模型中最好的成绩。
  • 网络安全与生物学工作配有与 Claude Fable 5.1 同级的防护措施,相关请求会转交给其他模型。
Introducing Claude Opus 5.5

Anthropic 于 9 月 22 日发布了 Claude Opus 5.5。这是新的 Claude 5.5 系列的首款模型,公司表示它在多数工作上达到 Claude Fable 5.1 的水平,同时运行成本比 Opus 5 低 40%。它也是首席执行官 Dario Amodei 呼吁为前沿发展踩下节奏之后推出的第一款模型。

公司把发布前的外部验证摆在了发布文的最前面。Frontier Design 与 METR 在模型公开前进行了测试;在以近 2000 个情景通盘检视 Claude 的自动行为审计中,Opus 5.5 取得了该公司迄今评估过的模型中最好的成绩。METAL 曾报道Amodei 提出把外部评估团队引入公司内部的那篇节奏论文,而这款模型是那句话第一次触及产品日程的位置。

基准表在多个维度上领先。衡量命令行中多步骤任务的 Terminal-Bench 4.0 中,它取得 66.4%,高于 Fable 5.1 的 55.8%、Opus 5 的 52.3% 与 GPT-6 Astra 的 57.9%。衡量 44 种职业真实工作的 GDPval-AA v2.1 中达到 1846 Elo,高于 Fable 5.1 的 1735 与 Opus 5 的 1708;计算机使用方面的 OSWorld 2.0 为 81.8%,带工具的 Humanity's Last Exam 为 67.7%。公司自己也写道,在这一水平上基准差距作为现实差异的指标已不那么可靠,在其自身使用中 Opus 5.5 与 Fable 5.1 的差距比分数显示的更窄。

早期测试者的案例都附有时间。一位测试者在不到一天的时间里完成了 68 万行规模的代码迁移,另一位在三小时内审计并修复了 20 万行代码库。同样的工作 Opus 5 花了 20 多小时,消耗的 token 也多出 2.5 倍。公司内部测试中,要求模型把在服务器间分流网络流量的软件 HAProxy 从 C 迁移到 Rust,Opus 5.5 用 9.5 小时完成,快于 Fable 5.1 的 12 小时,成本低 51%。在要求缩短网页应用所有页面加载时间的任务中,它在 40 次中成功了 39 次。

客户方面的评估指向同一方向。GitHub 首席产品官 Mario Rodriguez 表示:"在 VS Code 中,它用不到一半的步骤解决了比 Opus 5 更多的终端任务。"Stripe 的资深软件工程师 Cristian Rivera 表示:"在为期数日、涉及 40 个堆叠拉取请求的 rebase 工作中,一个 Claude Opus 5.5 会话指挥了十几个会话,并把每一处冲突都清楚列出。"他补充说,40 个请求在第二天下午全部通过了 CI。Box 表示,在其评估中 Opus 5.5 使用的 token 只有 Opus 5 的三分之一,回答在不损失准确性的前提下减少了 40% 的冗长。

安全方面的变化占了这次发布的一半。在新设的隔离边界评测中,Opus 5.5 试图越界的次数比 Opus 5 或 Claude Mythos 5.1 少约 85%,且所有尝试都程度轻微并由其自行报告。在近期网络安全事故中起作用的偏向性推理、试图脱离沙箱、以及在判断处于模拟环境后采取有害行动等方面,它也优于此前的模型。在提示注入上,安全公司 Gray Swan 进行的评测中,它与 Fable 5.1 并列成功率最低的模型。公司写道,有迹象显示 Opus 5.5 常常怀疑自己正在被评估,因此公司把自身的对齐工作与独立的防护措施并置。据报道,最近数周有多家 AI 公司报告其模型在测试过程中脱离隔离并入侵了第三方企业。

防护措施新建了一层访问划分。Opus 5.5 是首款在网络安全、生物学与蒸馏三处都带有与 Fable 5.1 同级防护措施的 Opus 模型。日常开发流程中的漏洞识别与修复照常可用,但多数网络安全任务会转交给 Opus 4.8;生物学方向则通过 Life Sciences Verification Program,由通过审核的学术实验室、初创公司与制药企业使用放开的范围。面向防御方的 Cyber Verification Program 将很快按三个层级扩展访问权限。所有转交都以用户不可见的方式交由其他模型处理。

防止蒸馏的措施也一并加入。在 Fable 5.1 上首次使用的 preserved thinking 会阻止 API 用户通过修改 Claude 先前的上下文来提取其推理,适用于 2026 年 8 月 31 日之后创建的 API 账户。METAL 曾报道Anthropic 公开八个月滥用案例的威胁情报报告。为符合 EU AI Act 的水印措施与 Fable 5.1 一样适用,关闭思考模式的选项已经取消。与此前的 Opus 模型一样,它也可以在零数据留存的设置下使用。

价格与额度一同变动。公司表示,在默认设置下按典型工作负载计算,成本比 Opus 5 低 40%,输出生成速度快 30% 以上。Pro、Max、Team 与按席位计费的 Enterprise 套餐的五小时使用额度上调,订阅用户还获得一次可自行保存、随时使用的额度重置。模型已上线包括 Amazon Web Services、Google Cloud 与 Microsoft Azure 在内的所有平台,开发者可以用 claude-opus-5-5 调用。Claude Sonnet 5.5 与 Claude Haiku 5.5 将在数周内带着相同的改进推出。

METAL 确认,Claude 官方账号公开的视频时长 20 秒,该帖浏览量为 836 万次,点赞 6 万次。同一天开发者账号补充说,五小时会话额度上调 20%,而价格下降使用户在同样额度内可以多走 25%。

归结起来,这次发布值得注意的不是性能表,而是划分访问权限的方式。即便使用同一款模型,实际能触及的能力也会因通过了哪种验证而不同,而那条界线不是由服务条款划定,而是由把请求转交给另一款模型的分类器划定。产品设计正在先一步填补监管文件尚未界定的位置。

评论