METAL LAB

Anthropic Fable 5.1、Mythos 5.1发布,价格最高降45%

同一模型按安全防护级别区分出两个版本,降低缓存读取价格压低成本,还用EFS改变了数据保留方式

摘要

  • Anthropic发布了Claude Fable 5.1和Claude Mythos 5.1,二者是同一模型,只是安全防护级别设置不同
  • 缓存读取价格下调后,普通任务成本降低约25%,高强度智能体任务成本最多可降低约45%
  • 今年秋季将推出EFS,把数据保存在客户自行掌控的云端,同时网络安全领域的误报也减少了60%
공식 발표 영상

6月9日发布Fable 5之后大约三个月,9月1日,Anthropic同时推出了面向编程与知识工作的新模型Claude Fable 5.1,以及专供网络安全和生命科学领域使用的Claude Mythos 5.1。这两款模型其实是同一个模型,只是安全防护级别设置不同:Fable 5.1面向所有人开放公测,而Mythos 5.1则仅限通过可信访问计划审核的企业和研究者使用。Anthropic将这两款模型称为"编程和知识工作领域全球最先进的模型",而本次发布中最引人注目的一点,是公司正面回应了此前客户在价格、数据保留和安全防护方面积累已久的不满。

Anthropic官方网站

具体来说,直到上个月为止,Anthropic的编程模型Fable虽然质量出色,但成本偏高,开发者们不得不把设计工作交给Fable、把重复性任务分给更便宜的模型来分摊负担;而访问控制和数据保留政策也曾促使部分企业和国家重新审视流量路径。Fable 5.1正是针对这三点不满而做出的更新。

Claude Fable 5.1 and Mythos 5.1 announcement

Fable与Mythos,唯一区别是安全防护

Claude Fable 5.1和Claude Mythos 5.1基于同一个底层模型,差异在于安全防护的严密程度:Fable 5.1面向编程、知识工作和长时间问题解决场景公开发布,而Mythos 5.1则叠加了专为网络安全和生命科学任务设计的独立安全防护措施,仅通过可信访问计划提供。Anthropic解释称,两款模型在Terminal-Bench 4.0得分上的差距,源于此前较不成熟的网络安全防护机制介入了部分任务;随着此次安全防护的改进,两款模型之间的性能差距预计会明显缩小。

Fable 5.1还新增了针对蒸馏(distillation)攻击的防御机制。今天起新建的API账户,将无法在保留Claude此前思维过程的同时,对多轮对话的上下文进行手动编辑——这是为了阻止一种已被公开披露的蒸馏手法:攻击者用成千上万个虚假账户套取模型的思维过程,再据此制作出没有安全防护的复制版本。

靠缓存读取降价,最多省45%

按代币计费的普通工作负载计算,Anthropic预计Fable 5.1的成本将比Fable 5低约25%。这得益于对"缓存读取"(即重新读取此前已处理并保存的输入内容)价格的下调:缓存读取费用从每百万代币1美元降到0.25美元,降幅达75%。对于长时间运行的高强度智能体任务而言,节省幅度最高可达约45%。不过需要注意的是,价格下调仅涉及缓存读取这一项,输入每百万代币10美元、输出每百万代币50美元的基础单价与Fable 5完全相同。

正如上周的背景报道所提到的,GLM 5.2等低成本模型以约为Fable九分之一的价格出现,促使开发者开始拆分任务分别处理,此次降价可以看作是Anthropic对这一趋势的回应。

缓存读取价格下调图表

不过有一点需要保留:基准测试分析机构Artificial Analysis指出,节省幅度会因具体工作方式而异。在缓存读取占比高的智能体任务中,每项任务可节省约1.40美元;但如果把努力程度调到最高(max),Fable 5.1会输出更多代币,反而使单项任务成本比Fable 5高出约20%。所谓"最高降45%",前提是默认设置下大量复用缓存的情况,这一点需要留意。

全体用户使用限额重置

发布的同时,Anthropic重置了所有用户的5小时和每周使用限额。官方开发者账号ClaudeDevs当天发布消息称,无论此前用量用到什么程度,从当天起都将重新计算,用户可以毫无负担地立即体验新模型。

数据由客户自己掌控——EFS

Anthropic推出了名为Enterprise Frontier Safeguards(EFS)的新数据保留体系。EFS的做法是,将数据存放在客户自己掌控的云基础设施中,而不是Anthropic的服务器上,同时依然保留业界最先进水平的滥用检测能力。据Anthropic介绍,这套方案能在提供完整隐私保护的同时,达到与"零数据保留"政策相当的水平;即便出现需要人工审核的情况,默认也是由客户自己执行,而非Anthropic。该体系是与金融、医疗、制造、通信、法律、零售、公共部门等100多家客户以及AWS、谷歌云、微软Azure共同开发的,支持Claude Code、Claude Enterprise、Claude Platform,以及Amazon Bedrock、谷歌智能体平台、微软Foundry。EFS将从今年秋季起分阶段推出,在此之前,符合条件的客户可以以零数据保留方式使用Fable 5.1。希望提前使用的企业可以通过申请表单提出申请。

误报减少的安全防护,生物学领域与政府合作

网络安全方面,新的安全防护机制减少了将无害内容误判为危险内容的情况——以Claude Code用户为例,每次会话的干预次数平均减少了约60%。这使得Fable 5.1可以用于发现软件漏洞这类防御性用途,不过利用这些漏洞制作攻击代码,或渗透测试、二进制漏洞扫描等双重用途任务,仍会被转给Opus模型处理。Claude Security此次已改为由Mythos 5.1驱动。

生物学领域的访问权限则受到严格管控。Fable 5.1的生物安全防护机制将初级生物学、医学问题等无害请求的误报率降低了85%,但研发性质的查询仍会转交给Opus模型处理。更高级的生物学功能,只能通过Anthropic与美国政府共同建立的生命科学验证计划(LSVP)、经由Mythos 5.1开放,目前首批参与者的注册已经完成,公司表示很快会扩大适用范围。

이미지: X — 프론티어랩 (웹검색)

迈向科学——蛋白质、金星地图、GPU内核

在本次发布中,Anthropic重点展示了两款模型在科学研究方面的能力,并称这是"AI即将对科学发现做出实质性贡献的早期迹象"。公司公布了三个案例。

第一个是分子设计。Mythos 5.1仅凭开源蛋白质设计工具,就设计出了能让药物更好地结合体内靶点的"结合体",并通过两家外部机构的实验验证:在12个靶点上的命中率约达50%。相较于目前行业通常10%到15%的命中率,这是Anthropic迄今测得的最高数值;在其中3个靶点上,其结合亲和力甚至比Adaptyv Bio设计竞赛的最佳作品高出10倍。

第二个是计算建模。Fable 5.1利用三十多年前NASA麦哲伦探测器拍摄的雷达影像训练神经网络,重新绘制出金星表面三分之一区域的高分辨率地形高程图。分辨率从原本的10到20公里提升到2到3公里,高度精度也提高了最多25%。Anthropic已将这张地图以知识共享许可协议公开,希望能助力NASA和ESA即将开展的金星探测任务。

第三个是计算生物学。Mythos 5.1为7种开源深度学习模型重新编写了GPU内核,在结果保持不变的前提下,速度最高提升了2.5倍。在全基因组扫描分析中,GPU成本降低了30%到60%——原本需要性能工程团队花上数周才能完成的工作,如今只需几天。

从基准测试看性能提升

Anthropic公布的自有基准测试显示,Fable 5.1在多个项目上相较前代有明显提升。在科学研究测试(Terminal-Bench-Science 0.1)中得分52.6%,超过Fable 5的两倍以上;在终端编程测试(Terminal-Bench 4.0)中,得分从42.0%提升到55.8%。

Fable 5.1基准测试对比图表
基准测试Fable 5.1Fable 5Opus 5GPT-5.6 Sol
科学研究(Terminal-Bench-Science 0.1)52.6%24.7%29.0%22.4%
智能体编程(Terminal-Bench 4.0)55.8%42.0%52.3%37.3%
知识工作(GDPval-AA v2)1853172318241711
计算机使用(OSWorld 2.0,部分)77.9%72.9%75.4%
多领域推理(HLE,含工具使用)65.0%63.8%63.6%
业务自动化(AutomationBench)31.4%17.1%26.9%19.6%
编程(CursorBench 3.2.0,最大努力度)73.4%70.5%70.0%67.2%

在Terminal-Bench 4.0测试中,Mythos 5.1以60.9%的成绩略高于Fable 5.1,Anthropic解释这是此前较不成熟的网络安全防护机制在部分任务中介入所留下的痕迹。早期访问客户的反馈也印证了这一点:运行BrowserBench测试的Browserbase表示,Fable 5.1能在约10分钟内完成82%的任务,且消耗的代币更少(Opus 5为74%,Fable 5为57%);在合同校对基准测试RedlineBench中得分从47.9提升到57.0;在投资研究基准测试FrontierFinance中从49.2%提升到55.9%。对冲基金Millennium的一位投资组合经理表示:"一个每百万次才出现一次的崩溃问题,四五年来没人能解释清楚,结果Fable 5.1反编译了第三方厂商的库文件,与核心转储进行比对后,甚至找出了那个库里的错误。"

如何使用

Fable 5.1可以直接在claude.ai、Claude Code或Claude Cowork中使用,并已于当天起在包括AWS、谷歌云、微软Azure在内的所有平台上线。若要通过API接入,可前往platform.claude.com,使用claude-fable-5-1模型即可开始。模型提供Low、Medium、High三档努力程度可选,Claude Code中默认设置为High,Claude Cowork和claude.ai中默认设置为Medium。Anthropic表示,即使调低到Low或Medium档位,也能以更低成本获得与Fable 5在High档位相当甚至更好的结果。

Mythos 5.1并非普通用户可以直接使用的模型。目前仅面向美国境内部分机构开放:网络安全方向的访问需申请CVP计划,生物学方向则需申请注册前文提到的LSVP。

已经在编程任务中试用过Fable 5.1的案例,可参见以下报道:

实战演示,看Fable 5.1如何工作

Anthropic还通过三段简短的演示视频,展示了Fable 5.1在实际工作中的表现。

让Fable 5.1整夜运行预测任务 · 来源:Anthropic
跨越整个技术栈进行调试 · 来源:Anthropic
在Slack中生成运营复盘报告的Fable 5.1 · 来源:Anthropic

编辑视角

用一句话概括这次更新:Anthropic是在自己搬起石头砸自己的脚之前,先下手为强。正如我们上个月报道过的,Fable高昂的成本一直在把开发者推向GLM 5.2这类低价模型,而OpenAI也大幅下调了GPT-5.6的价格,正面迎战来自中国的低价模型。此次把价格最多降低45%,与其说是防守,不如说更像是一次先发制人的应对。

从代际对比来看,这一点会更清晰。据Anthropic介绍,Fable 5只有在High努力度下才能勉强给出令人满意的结果,而Fable 5.1即便在Low或Medium档位也能超越那个水准。把这类规模的模型放到实际业务中检验,结论往往大同小异:真正拉开差距的不是模型的最高性能,而是它在低配置下依然能维持的表现。因为对企业而言,成本是由默认配置决定的,而不是由顶配决定的。

由此可以总结出三点实务启示。第一,如果团队一直担心数据保留问题,不妨密切关注EFS分阶段推出的时间表,并先确认自己现在是否符合切换到零数据保留方案的条件。第二,安全团队值得花几周时间观察,干预次数减少60%究竟能在多大程度上缓解告警疲劳。第三,看价格时不要只盯着"最高降45%"这个上限值,而应根据自身工作负载中缓存实际的复用比例来测算。

值得关注的是,Anthropic这次把科学研究放到了发布的核心位置。蛋白质结合体、金星地图和GPU内核优化,虽然都在编程基准测试之外,却清楚地表明这家公司正把下一场竞争的舞台设在哪里。价格与安全防护之间的拉锯战不会就此结束,而与此同时,一条名为"做科学的模型"的新战线正在打开。

评论