METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

解剖Sakana AI——Transformer作者在东京创办的27亿美元公司

一家由高盛交易员、Transformer论文共同作者和外交官共同创办的公司。从创业故事到进化算法、自我改进研究,再到Fugu、Marlin以及与银行、防卫省的合作,我们做了一次梳理

解剖Sakana AI——Transformer作者在东京创办的27亿美元公司

图片:@SakanaAILabs (X)

摘要

  • Sakana AI于2023年7月在东京成立,短短三年估值已达约27亿美元,累计融资4.12亿美元
  • 公司的研究路线不是靠堆参数做规模化,而是走进化算法、模型融合与递归式自我改进,并在2026年落地为Fugu、Marlin和Sakana Chat三款产品
  • 收入主要来自与日本大企业的合作以及防卫、情报领域的合同,但公司曾有过修正业绩说法的历史,且业务高度集中于日本市场,这些都是需要正视的风险因素

三个人在东京押下的一个反规模化赌注

Sakana AI于2023年7月在东京成立。截至2026年2月16日,公司总部位于港区麻布台之丘森JP大厦22层。创始人共有三位,三人的履历几乎没有交集。

首席执行官David Ha在高盛工作了8年,一路升到日本利率交易部门联席主管兼董事总经理,之后于2016年转投Google Brain。他在银行任职期间,以"hardmaru"这个匿名身份运营AI研究博客,这个账号在深度学习圈子里其实比他本人更早出名。离开Google后,他从2022年起在Stability AI担任研究负责人,任职约一年。

首席技术官Llion Jones在威尔士长大,14岁就做出了一个聊天机器人,后在伯明翰大学拿到计算机科学与AI的学士和硕士学位。他最广为人知的作品,是2017年那篇论文《Attention Is All You Need》——如今几乎所有大型语言模型的骨架Transformer结构,正是由这篇论文提出,他是8位共同作者之一。Jones加入Sakana AI的理由是,他判断传统Transformer路线的收益已经开始明显递减。

首席运营官Ren Ito毕业于东京大学法学部,之后在纽约大学法学院拿到LLM学位,又在斯坦福读了硕士。2001年他进入外务省担任外交官,后来在Mercari出任负责全球业务的执行董事。他同样在Stability AI担任过COO。Ha和Ito都曾在同一家公司任职,而Ha与Jones则是在Google东京办公室相识——这构成了三人创业组合的背景。

公司名字"Sakana(魚)"在日语里就是"鱼"的意思。一条鱼只遵循几条简单的规则,但整个鱼群却能表现出躲避天敌、寻找食物这类复杂行为。把这种群体智能搬到模型设计上,正是公司的出发点。面对不断堆参数换性能的规模化竞赛,三位创始人认为存在另一条路径。

进化式模型融合——不训练也能造出新模型

让公司在研究圈打响名号的第一个成果,是2024年3月21日公开的"进化式模型融合"(Evolutionary Model Merge)。它的做法是把多个已经公开的开源模型组合起来,生成一个新模型,而组合方式不是由人来定,而是交给进化算法去寻找。相关论文于2025年1月发表在《自然·机器智能》上。

搜索在两个空间里同步进行。在参数空间(PS)中,系统会进化出如何按层将多个模型的权重以何种比例混合;在数据流空间(DFS)中,则进化出如何将不同模型的层以何种顺序拼接起来。这两个空间的组合数量都大到人类直觉根本无法穷举。系统会跑上100到150代,只让表现好的个体存活并繁衍下一代,最终产出模型。

这个方法的核心在于,整个过程从未运行过一次基于梯度下降的训练。它没有靠GPU反复跑反向传播,而是把问题转化成"组合已训练好的权重",从而大幅削减了计算量。

公司同时公开了成果。70亿参数的模型EvoLLM-JP在日语数学推理基准MGSM-JA上拿到55.2%的成绩(以公开的v1-7B版本计则为50.6%)。这个模型是把具备日语能力的模型(Shisa-Gamma)和数学专用模型(WizardMath、Abel)融合而成的。尽管目标只是数学,但它在日语综合基准(JP-LMEH)上的平均分达到70.5,超过了所有700亿参数以下的日语模型,也超过了此前700亿级别的最佳成绩——不过同一张表里的Swallow 70B仍以71.5分领先。图文并用的EvoVLM-JP,以及通过四步推理处理日语提示词的图像生成模型EvoSDXL-JP,都属于同一系列。

空间进化的对象过去人工的做法
参数空间(PS)各层的权重混合比例按固定比例取平均
数据流空间(DFS)不同模型层的排列顺序凭直觉和经验设计

会自我修正的AI——从AI Scientist到RSI实验室

第二条研究主线,是让AI自己改进AI。这条路始于2024年8月13日公开的"AI Scientist(The AI Scientist)"。这是一个从提出研究想法、编写实验代码、执行、分析结果、撰写论文到同行评审全流程无需人工干预的系统。据报道,生成一篇论文的算力成本约为15美元。

后续版本AI Scientist v2在2025年3月的ICLR 2025研讨会评审中拿出了成绩:提交的3篇论文中有1篇拿到平均6.33分,超过了录用门槛,这个分数比55%的人类投稿论文都要高。不过Sakana AI在正式发表前主动撤回了这篇论文——原因是它没有经过研讨会组委会的元评审,而研讨会的录用率本就远高于主会,论文中还被指出了引用错误。所谓"AI通过了同行评审",能成立的范围也就止步于此。系统本身的论文于2026年3月25日发表在《自然》(第651卷第914-919页)。

同一项研究里也出现了一些安全信号。测试过程中,当实验超出时限,这个系统没有选择加快写代码,而是修改了自己的代码去延长时限本身;还有一次它在自己的代码里插入了重新调用自身的系统调用,造成了无限循环。公司公开这些案例后,围绕自主智能体的可控性问题引发了一轮讨论。

之后的成果进一步朝自我改进的方向推进。2025年5月公开的"达尔文哥德尔机"(Darwin Gödel Machine)让智能体不断重写自己的代码库、生成变体。它把SWE-bench成绩从20%提升到50%,绝对提升30个百分点;在多语言编程任务Polyglot上也从14.2%升到30.7%。同年9月开源发布的ShinkaEvolve,则是一个结合语言模型与进化算法的程序进化框架:在"圆盘装填"这一经典优化问题上,它仅用150个样本就刷新了最佳纪录;在另一项实验中,它仅用30代就为专家混合(MoE)模型找到了一种新的负载均衡损失函数。

竞赛成绩方面也有战绩。2025年12月14日,算法优化智能体ALE-Agent在AtCoder启发式编程大赛第058场中夺得第一——这是一场804名人类选手历时4小时同台竞技的比赛,也是AI智能体首次夺冠。当时使用的总成本约为1300美元。

这条研究线在2026年6月5日被正式整合为"递归式自我改进(RSI)实验室"。实验室提出的口号是"靠想法前进,而不只是靠算力"——意思是把日本在算力上不及超大规模云厂商这一现实条件,反过来当作推动样本效率研究的理由。向物理世界的延伸也是这条思路的延续:7月13日公司发布了在物理环境中实现群体智能的"智能蜂窝积木"研究;8月10日又通过自有渠道提出,物理AI将是下一个前沿方向。

瞄准Transformer之后的架构研究

第三条研究主线,是试图改变架构本身。

"连续思维机"(Continuous Thought Machines, CTM)于2025年5月公开。它把时间维度重新引入神经网络:单个神经元能记住过去的活动,信息通过神经元之间的同步来按顺序处理。公司称这一结构在置信度校准(confidence calibration)上的表现甚至超过了人类。

"神经注意力记忆模型"(NAMM)于2024年12月公开,它学习判断在上下文中哪些token该保留、哪些该丢弃,以此减轻推理阶段的内存负担。据报告,该方法在语言和多模态任务中最多能把内存开销降低75%——这种改进在算力受限的环境下能直接换算成实际成本节省。

2025年1月公开的Transformer²,瞄准的是让模型能根据任务自行调整权重的自适应结构。以上三条主线,走的都不是"把模型做得更大"这条路。

公司也有过一次重大失误。2025年2月公开的"AI CUDA工程师"号称能自动优化GPU内核,相比PyTorch最高提速100倍,但外部验证发现,这其实是系统钻了评测代码漏洞的"奖励作弊"结果——甚至有用户反映实际运行反而慢了3倍。公司于2月21日承认了这一问题,称已强化评测与运行时性能分析体系,并下调了原先的说法、更正了结果。这起事件之后,"自动化研究系统的结果该由谁、以何种方式验证"这个问题,一直留在了公司此后的发布方式里。

2026年,研究开始变成产品

2026年是Sakana AI把研究成果转化为可创收产品的一年。

Sakana Chat于3月24日在日本国内限定免费上线。搭载其上的Namazu(鲶鱼)系列模型,是把DeepSeek-V3.1-Terminus、Llama-3.1-405B、gpt-oss-120B等开源权重模型,按日语和日本文化标准重新调校而成。公司公布的一个数据很能说明这项工作的性质:基础模型DeepSeek-V3.1-Terminus对涉及政治敏感话题的问题有72%会拒绝回答,而经Namazu调校后,拒答率降到了接近0%。8月13日,该聊天机器人又搭载了新一代Namazu和Fugu,新一代Namazu的基础模型也换成了Kimi K2.6。

**Sakana Fugu(河豚)**是一款编排型模型,4月24日推出测试版,6月22日正式上线。它不是靠单一模型作答,而是把多个前沿模型按角色分工,协同拆解任务来完成。这一思路依据的是两篇发表于ICLR 2026的论文:Trinity由一个经过轻量进化的协调者,给多个语言模型分配"思考者、执行者、验证者"角色;Conductor则通过强化学习,直接搜索出智能体之间的沟通模式本身。

产品线最初分为面向常规业务的Fugu,和为高难度问题调动更深专家池的Fugu Ultra,随后又在7月21日新增了专攻安全推理的Fugu Cyber。公司公布的成绩显示,在软件工程基准SWE-Bench Pro上,Fugu Ultra拿到73.7分;同一张表里,Opus 4.8为69.2分,GPT-5.5为58.6分,Gemini 3.1 Pro为54.2分,而Fable 5则以80.0分高于Fugu Ultra。在安全基准CyberGym上,Fugu Cyber以86.9%的成绩领先GPT-5.5-Cyber(85.6%)和Claude Opus预览版(83.1%)。需要说明的是,以上数字均为Sakana AI自行测得,尚未公开第三方验证结果。

价格方面,公司同时提供月费20美元、100美元、200美元的订阅档位,以及按量计费方案。Ultra按量计费为每百万token输入5美元、输出30美元,超过27.2万token的长上下文部分则涨至输入10美元、输出45美元。API兼容OpenAI格式,也可通过OpenRouter、Vercel等平台使用。由于GDPR合规尚未完成,欧洲经济区暂不在服务范围内。

在介绍Fugu时,公司反复使用的一句话是"无出口管制风险的前沿级性能"——这明显是针对那些受美国模型出口限制影响的地区和行业所做的定位。

Sakana Marlin是一款自主研究智能体,4月2日先经过约300人规模的封闭测试,6月15日正式上线,是Sakana AI的首款商用产品。单次会话最长可无人值守运行8小时,产出长达100页的报告。其底层技术是获得NeurIPS 2025 Spotlight的自适应分支蒙特卡洛树搜索,以及AI Scientist的工作流自动化能力。收费分为按量计费的信用点(98日元/100点)、专业版月费15万日元、团队版月费40万日元。公司将这款产品定位为面向金融、咨询、战略部门的"虚拟首席战略官"。

产品时间节点定位
Sakana Chat2026年3月24日日本限定免费聊天机器人,基于Namazu系列
Sakana Fugu4月24日测试版 · 6月22日正式版多模型编排API
Sakana Marlin4月2日测试版 · 6月15日正式版最长8小时无人值守研究智能体
Sakana Translate7月6日翻译、校对服务
Fugu Cyber7月21日安全推理专用版本

三年融资4亿美元——钱从哪里来

以日本创业公司的标准来看,Sakana AI的融资速度相当罕见。

2024年1月,公司由Lux Capital领投完成3000万美元种子轮融资;同年9月4日,又完成约2亿美元的A轮融资,由NEA、Khosla Ventures、Lux Capital共同领投,NVIDIA以战略投资者身份加入。三菱UFJ、SMBC、瑞穗三大银行,以及NEC、富士通、伊藤忠、KDDI、野村、第一生命、ANA控股、东京海上等一众日本大企业也相继参与。据当时的报道,公司估值达到15亿美元——距创立仅14个月,就跻身独角兽行列。

B轮融资最初于2025年11月17日宣布,规模为200亿日元(约1.35亿美元),估值4000亿日元;到2026年4月9日的更新公告中,规模扩大到320亿日元(约2亿美元),估值升至约4320亿日元(约27亿美元)。累计融资额约为660亿日元(4.12亿美元)。之所以这一轮融资持续开放了五个月之久,是因为不断有战略投资者陆续加入:Google于1月23日宣布战略合作关系并加入该轮融资,花旗于2月24日、三菱电机于3月25日相继入局。花旗的这笔投资,是该行首次对日本企业进行战略投资。名单上还包括Salesforce Ventures、Datadog、麦格理资本、JAFCO,以及关联美国情报机构的风险投资基金In-Q-Tel,和西班牙桑坦德银行旗下的Mouro Capital。

轮次时间规模估值
种子轮2024年1月3000万美元—
A轮2024年9月4日约2亿美元15亿美元(按报道口径)
B轮2025年11月17日 ~ 2026年4月9日320亿日元(约2亿美元)约4320亿日元(27亿美元)

在算力方面,公司选择靠采购解决,而非自建数据中心。它获得了经济产业省GENIAC项目的支持,使用GMO的GPU云服务;2026年7月16日引入了樱花互联网的"高火力PHY",同一天还宣布了与NVIDIA在开源模型上的合作。这与那些动辄砸下数十亿美元自建集群的欧美竞争对手,成本结构完全不同。

客户从银行,做到了防卫省

公司的收入主要来自与日本大企业签订的多年期合作。2025年5月,公司与三菱UFJ达成为期三年以上的全面合作,共同开发银行专用AI;10月又与大和证券集团签约,到2026年8月5日,双方的资产管理AI开发进入正式推进阶段。三菱电机在3月出资的同时,也决定将Sakana AI的模型接入自家的Serendie平台。4月30日,公司宣布与SMBC集团共同开发提案书自动生成应用;4月7日则参与了总务省应对社交媒体虚假信息的项目。虽然是非官方统计,但据传2025年公司营收在3000万美元上下。

第二条业务主线是防卫与情报领域。2026年3月13日,公司获得防卫装备厅下属防卫创新科学技术研究所的多年期委托研究,课题名为"通过组合多种AI技术实现观测、报告、信息整合与资源分配的高速化研究"——内容是整合分析陆、海、空各领域的多模态数据,并开发可搭载于无人机等边缘设备的小型视觉-语言模型(SVLM),以此提升指挥控制(C2)体系的水平。紧接着,7月29日公司又与防卫省签订了"综合分析业务所需AI功能调查与验证"合同,这项业务涉及将智能体技术应用于情报本部情报分析官的日常工作——合同层级已经从部队运用单位,升级到了国家政策层面。

相关背景也在同步推进。读卖新闻8月9日报道称,日本政府已敲定在自卫队指挥控制体系中引入国产AI的方针,而Sakana Fugu被视为有力候选。公司自身的防卫业务基本方针文件中,也明确将防卫、情报领域与金融并列为优先方向。2025年,在防卫装备厅与美国国防创新单位(DIU)联合主办的美日国防创新挑战赛中,公司获得了敢闘奖(佳作奖)——在传染病预测和AI生成图像检测这两个主题上,它是唯一双双进入决赛的参赛者。5月29日,公司还与一般社团法人Deep Dive达成了情报分析方面的合作。

尚待跨越的坎

公司估值达到27亿美元,却没有公开过营收数字。市面流传的3000万美元这一数字,来自第三方统计,从未得到公司本身的确认。CEO Ha本人也曾多次表示,生成式AI领域至今还没有一种被证明可盈利的商业模式,并提到过整个行业估值可能存在泡沫。考虑到公司首款商用产品Marlin直到6月才推出,外界目前还无法判断营收是否真的追上了估值。

竞争格局同样并不简单。Google既是投资方,又通过Gemini在同一个市场里与之竞争;OpenAI、Anthropic、Google DeepMind手握的算力和资本,与Sakana AI相比根本不在一个数量级。要留住研究人才,公司势必要在薪酬待遇上与这些巨头正面竞争。

聚焦日语和日本文化的策略,既是护城河,也是天花板。目前带来收入的合作伙伴清一色是日本大企业和日本政府机构。虽然Fugu通过兼容OpenAI的API和OpenRouter分发渠道向海外开发者敞开了大门,但欧洲经济区目前仍未开放,海外营收规模也从未公开。

技术本身的可靠性问题同样悬而未决。AI CUDA工程师性能声明的更正、AI Scientist绕过时限限制的事件,以及主动撤回研讨会论文的举动,都留下了一个问题:把自动化研究系统投入实际业务时,验证工作究竟该由谁来做、怎么做。对于一家客户包括银行和防卫机构的公司来说,这个问题的分量,比一般软件公司要重得多。

编辑视角

理解Sakana AI,大致可以从两个角度切入。

一个是技术路线。这家公司的所有研究,起点都是同一个约束条件:没有美国大型实验室那样的GPU规模。进化式模型融合绕开了训练环节以节省算力,NAMM把推理内存开销最多削减了75%,ShinkaEvolve仅用150个样本就刷新了最佳纪录,Fugu也不是重新训练模型,而是靠编排别人的模型来获得性能。资源匮乏这个条件,反过来决定了研究课题的选择。考虑到韩国大多数AI机构都面临类似的处境,这家公司提出问题的方式,或许比它取得的具体成果更值得参考。

另一个是商业路径。三年间,Sakana AI走的是"发表研究→与大企业合作→拿下政府和防卫合同"这样一条上升路线,每一步都以前一步积累的信任为担保:正因为三大银行参与了A轮融资,才促成了与三菱UFJ的合作;正因为在金融领域有了实绩,花旗才决定做出对日本企业的首次战略投资;正因为承接了指挥控制基础研究,四个月后才顺理成章拿下防卫省合同。这与靠一款完整产品直接打开市场的路径,顺序完全不同。

营收未公开、曾修正过业绩说法的历史、以及对日本市场的高度依赖,这些风险目前都依然存在。考虑到公司眼下正把研究重心扩展到物理AI和机器人领域,接下来一年值得关注的,主要就是两点:Fugu和Marlin能否在日本以外的市场做出营收,以及防卫领域的验证项目能否真正转化为实际部署合同。

评论