METAL

Sakana AI发布两款替你挑模型的模型

Fugu Max把每项任务交给能解决它的最轻量模型,输出价格比同类低40%到60%。Fugu Ultra v2则在模型池里没有Fable 5.1和GPT-6 Astra的情况下拿到最高分。

Sakana AI发布两款替你挑模型的模型

图片:METAL

摘要

  • Sakana AI于9月11日发布两款编排模型Fugu Max与Fugu Ultra v2。两者共用同一套编排架构,Fugu Max面向成本,Fugu Ultra v2面向最高性能。
  • Fugu Max每百万输入词元2美元、每百万输出词元6美元,输出价格比Sonnet 5、GPT 5.6 Terra和Kimi K3低40%到60%,并在六项基准上拿到同价位区间的最高分。
  • Fugu Ultra v2在Chartography上得48.3分,在DeepSWE上得74.3分。公司在图表注释中写明,Fable 5、Fable 5.1和GPT-6 Astra都不在其模型池内。

Sakana AI没有继续把单个模型做大,而是给“在多个模型之间做选择”这件事标了价。9月11日,公司发布了两款编排模型Fugu Max与Fugu Ultra v2,并表示两者使用同一套编排架构,只是目标设定不同。Fugu Max追求用最低成本给出同样的答案,Fugu Ultra v2则追求在需要多步推进的难题上把分数推到最高。

如果觉得“编排”这个词抽象,可以想想呼叫中心。接起电话的话务员不会独自解决所有问题,而是听清对方要什么,再转给负责信用卡或保险的同事。Fugu就是坐在话务员位置上的模型,它读懂请求,并当场决定把哪一部分交给哪个模型。公司写道,“最强的AI绝不会来自单一的庞大模型”,而是“会来自智能的、集体的编排”。

Fugu Max这边的数字都挂在价格上。据公司介绍,Fugu Max每百万输入词元收2美元,每百万输出词元收6美元,输出价格比Sonnet 5、GPT 5.6 Terra和Kimi K3低40%到60%。在基准测试上,它在Terminal Bench 2.1、GPQAD、AA-LCR、GDP.pdf、AutomationBench和SWEFish这六项上拿到同价位区间的最高分;公司还表示,它在十项基准中的七项上把性价比的边界往外推了一截。

把价格压下来的办法不是减少模型,而是增加模型。公司表示,Fugu Max扩大了可供编排的模型池,以前所未有的规模纳入开放权重模型和专用模型,并通过与NVIDIA的合作把Nemotron系列放进了池子。公司解释说,通过把任务动态路由给能够解决它的最轻量模型,Fugu Max“只用一小部分词元开销就能给出前沿级别的结果”。其主张是:可选项越多,便宜的答案就越常够用。

Fugu Ultra v2瞄准的是另一端。公司表示,这款模型面向多步推理、自主研究和全栈软件开发。差距拉得最开的,是那些需要长时间盯住图表和结构化材料的工作:在衡量图表阅读的Chartography上,它拿到48.3分,而Opus 5为27.3分、Fable 5为29.5分。在衡量软件修复的DeepSWE上,公司称其74.3分压过了价格高出三到五倍的模型。

这次发布中最值得注意的,是公司自己钉死的那个前提条件。图表下方的注释写明,Fugu Ultra v2的训练数据截止日期为2026年8月28日,而Fable 5、Fable 5.1和GPT-6 Astra都不在Fugu Ultra v2的模型池内。这既意味着分数不是借别家顶级模型攒出来的,也意味着这是在当下最强的三个模型缺席时跑出的成绩。公司表示,Fugu Ultra v2在八项基准中的五项拿到最高分或并列最高分,在七项上进入前两名。

这家公司真正下手的地方,是性能曲线的形状。发布文的前提是:竞争不该只看模型规模,而要同时看能力与成本这两个轴;公司把“把这条边界往外推”写成了两款模型的共同目标。METAL此前报道过编程AI的竞争正是在同一条性价比边界上展开的,而这次发布提出的问题是:把这条边界往外推的,能不能是编排结构而非单个模型。

Fugu这个名字并非这次才出现。METAL曾报道该公司把名为Namazu和Fugu的两个模型装进自家聊天机器人,Fugu从那时起就是这家公司编排系列的名字。这次推出的两款,把这个系列拆成了便宜的一边和强的一边。

METAL查阅的技术报告写明了这套编排结构是怎么建起来的。在6月19日公开的报告中,公司把Fugu定义为一种读取用户请求、并即时搭建智能体脚手架的模型,并表示同时用到了大规模微调、进化算法和强化学习。报告以“不同厂商正在各自领域走向专门化”为前提,把这些专长汇成一个集体智能作为目标。如果说6月那一版证明了编排层也能在难题基准上追平封闭的前沿模型,那么按公司的说法,这一版把这个上限又抬高了。

从使用方来看,切换成本很低。公司表示两款模型都通过其标准的OpenAI兼容API提供,已有的Fugu用户只需改一行参数,不需要迁移。在产品页和控制台上就能直接开启。没有公开的部分同样清楚:公司没有公布Fugu Ultra v2的价格,除NVIDIA Nemotron系列外也没有点名池中的任何开放权重模型。

读编排模型的成绩单时,值得盯住的是比较对象。公司列出的最高分大多附有“同价位区间”的限定,而且是以十项中的七项、八项中的五项这种子集形式写出来的。“赢过所有人”和“在同样价格上赢过所有人”是两种不同的主张,而这份发布文选了后者。只要撑起这些分数的模型池构成一天不公开,外部就无法照样复现这套测量。

编排之所以能把价格压下来,道理很直白。要给出同样的答案,并不需要动用最贵的模型;池子越宽,避开它的余地就越大。Sakana AI这次把“不会因厂商锁定、API被撤销或服务突然中断而动摇的基础设施”摆在了前面,而支撑这一主张的,正是在某一家最强的三个模型缺席时攒出的分数。购买AI的依据正在从模型的名字转向单位工作的成本,编排模型就站在这一转变的最前列。

评论