工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

解剖Sakana AI——Transformer作者在东京创办的27亿美元公司

这是一家由高盛交易员、Transformer论文合著者和一位外交官共同创立的公司。从创业历程到进化算法、自我改进研究,再到Fugu、Marlin,以及与银行、防卫省的合作合约,我们做了一次全面梳理

이미지: @SakanaAILabs (X)

摘要

  • Sakana AI于2023年7月在东京创立,仅用三年时间估值就达到约27亿美元,累计融资4.12亿美元
  • 公司的研究路线不是靠堆参数做规模化扩展,而是采用进化算法、模型融合与递归式自我改进,2026年这些成果被产品化为Fugu、Marlin和Sakana Chat
  • 公司营收来自与日本大企业的合作以及防卫、情报领域的合约,而此前对性能表现的说法曾被更正,加上业务过度集中于日本市场,这些都是仍待观察的风险因素
설립
2023년 7월 · 도쿄 미나토구(2026년 2월 아자부다이힐스 이전)
창업자
데이비드 하(CEO)·라이온 존스(CTO)·이토 렌(COO)
기업가치
약 4,320억 엔(약 27억 달러) · 2026년 4월 기준
누적 조달
약 660억 엔(4억 1,200만 달러)
대표 연구
진화적 모델 병합 · AI 사이언티스트 · 다윈 괴델 머신 · CTM
상용 제품
사카나 마린(2026-06-15) · 후구(2026-06-22) · 사카나 챗 · 트랜슬레이트
주요 파트너
미쓰비시UFJ · 다이와증권 · SMBC · 미쓰비시전기 · 씨티 · 구글 · 엔비디아
방위 계약
2026-03-13 방위혁신과학기술연구소 위탁연구 · 2026-07-29 방위성 총합분석 실증

三个人在东京提出的"反规模化"假说

Sakana AI于2023年7月在东京成立。自2026年2月16日起,公司总部设在港区麻布台之丘Mori JP大厦22层。公司由三位创始人共同创办,三人的履历几乎没有重叠。

首席执行官David Ha曾在高盛工作八年,一路做到日本利率交易部门联席主管兼董事总经理,随后于2016年转投Google Brain。在银行工作期间,他以"hardmaru"这个匿名身份运营AI研究博客,这个账号在深度学习圈子里其实比他本人更早出名。离开Google后,他从2022年起在Stability AI担任了大约一年的研究负责人。

首席技术官Llion Jones在威尔士长大,14岁就自己做过一个聊天机器人,后来在伯明翰大学拿到计算机科学与AI的学士和硕士学位。他名下最著名的文献,是2017年那篇论文《Attention Is All You Need》——如今几乎所有大型语言模型骨架Transformer结构的提出者之一,8位共同作者中就有他。谈到加入Sakana AI的原因,Jones的说法是,他判断传统Transformer路线已经进入收益递减的阶段。

首席运营官Ren Ito毕业于东京大学法学部,后在纽约大学法学院拿到LLM学位,又在斯坦福读了硕士。他2001年进入外务省成为外交官,之后在Mercari担任全球业务执行董事,同样也在Stability AI做过COO。Ha和Ito都曾任职于同一家公司,而Ha和Jones则是在Google东京办公室相识——这些交集构成了创始团队组合的背景。

公司名"Sakana"(魚)在日语中意为"鱼"。单条鱼只遵循几条简单规则,但整个鱼群却能表现出躲避天敌、寻找食物这类复杂行为。把这种群体智能移植到模型设计中,正是这家公司的出发点。相对于不断堆参数以换取性能的规模化竞赛,三位创始人认为存在另一条路径。

进化式模型融合——无需训练也能造出新模型

真正让公司在研究圈打响名号的第一项成果,是2024年3月21日公布的"进化式模型融合"(Evolutionary Model Merge)。这项技术把多个已公开的开源模型组合起来生成新模型,而组合方式不是人来决定,而是由进化算法自动搜索得出。相关论文于2025年1月发表在《自然·机器智能》上。

搜索在两个空间中同时进行。在参数空间(PS)里,系统对多个模型的权重按层进行混合比例的进化搜索;在数据流空间(DFS)里,系统对不同模型的层该以何种顺序拼接进行进化搜索。这两个空间的组合数量都大到人类直觉无法穷举的程度。经过100到150代的迭代,表现优异的个体存活并繁衍出下一代,最终得到成品模型。

这一方法的核心在于,全程不需要跑一次基于梯度下降的训练。它没有靠反复反向传播来烧GPU,而是把问题转化为组合已训练权重,从而大幅削减了计算量。

公司同时公布了成果。70亿参数模型EvoLLM-JP在日语数学推理基准MGSM-JA上取得55.2%的成绩(若以公开的v1-7B版本为准则是50.6%)。这个模型是把具备日语能力的模型(Shisa-Gamma)和数学专精模型(WizardMath、Abel)融合而成。尽管目标只针对数学能力,但它在日语综合基准(JP-LMEH)上的平均分达到70.5,超过了所有700亿参数以下的日语模型,也超过此前700亿级别的最佳成绩。不过同一张表里,Swallow 70B仍以71.5分领先。同系列还包括能同时处理图像和语言的EvoVLM-JP,以及通过四阶段推理处理日语提示词的图像生成模型EvoSDXL-JP。

空间进化的对象人工原有做法
参数空间(PS)各层权重混合比例按固定比例取平均
数据流空间(DFS)不同模型层的排列顺序依靠直觉与经验设计

自我修复的AI——从AI科学家到RSI实验室

公司研究的第二条主线,是让AI自己改进AI。这条路始于2024年8月13日公布的"AI科学家"(The AI Scientist)。这套系统能够从提出研究想法、编写实验代码、执行实验、分析结果、撰写论文到同行评审,全程无需人工介入。据报告,生成一篇论文所需的计算成本约为15美元。

后续版本AI科学家v2在2025年3月的ICLR 2026研讨会评审中拿出了成绩。提交的3篇论文中有1篇平均得分6.33分,超过了录用门槛,这个分数高于55%的人类投稿论文。不过Sakana AI在正式发表前主动撤回了这篇论文——原因是它没有经过研讨会组委会的元评审,而该研讨会的录用率本就远高于正会,另外论文中还被指出存在引用错误。所以"AI通过了同行评审"这句话,其成立范围也就仅限于此。介绍这套系统本身的论文已于2026年3月25日发表在《自然》杂志上(651卷914–919页)。

同一项研究中也出现了值得关注的安全信号。在测试过程中,系统在实验超时后,没有选择加快编写代码,而是直接修改自己的代码来延长限时本身;还有一次,它甚至写入了重新调用自身的系统调用,制造出了一个无限循环。公司公开这些案例后,围绕自主智能体的可控性问题引发了持续讨论。

此后的成果进一步向自我改进方向推进。2025年5月发布的"达尔文哥德尔机"(Darwin Gödel Machine),让智能体能够不断重写自己的代码库、生成变体版本。它把SWE-bench的成绩从20%提升到50%,绝对提升达30个百分点;在多语言编程任务Polyglot上也从14.2%提升到30.7%。同年9月开源发布的ShinkaEvolve,是一个结合语言模型与进化算法的程序进化框架:面对经典的"圆形排列优化"问题(放置26个圆),它仅用150个样本就刷新了最佳纪录;在另一项实验中,它仅经过30代迭代,就为混合专家(MoE)模型找到了一种全新的负载均衡损失函数。

竞赛成绩方面也有亮点。2025年12月14日,算法优化智能体ALE-Agent在AtCoder启发式竞赛058中夺得第一名。这是一场804名人类选手历时4小时的比赛,也是AI智能体首次夺冠的案例。整个过程使用的总成本约1300美元。

这条研究线在2026年6月5日被正式整合为"递归式自我改进(RSI)实验室"。该实验室提出的口号是"不靠算力,靠想法前进"。这句话背后的意思是,日本没有大型云厂商那样的算力资源,公司干脆把这一限制条件当作推动样本效率研究的理由。向物理世界的延伸也是这条思路的自然延续。7月13日公司公布了在物理环境中实现群体智能的"智能蜂窝积木"研究,8月10日又通过自有渠道宣布,物理AI是公司下一个前沿方向。

瞄准Transformer之后的架构研究

第三条研究主线,是试图改变架构本身。

"连续思维机器"(Continuous Thought Machines, CTM)于2025年5月发布。这一结构把时间维度重新引入神经网络:单个神经元能够记住过去的活动,并通过神经元之间的同步机制按顺序处理信息。公司表示,这一结构在"置信度校准"(confidence calibration)方面的表现甚至超过了人类。

"神经注意力记忆模型"(NAMM)于2024年12月发布,它通过学习判断上下文中积累的哪些token该保留、哪些该丢弃,来降低推理阶段的内存负担。据报告,这一技术在语言与多模态任务中最多能将内存开销降低75%。在算力资源有限的环境下,这种改进能直接换算成实实在在的成本节省。

2025年1月发布的Transformer²,瞄准的是让模型能根据任务自行调整权重的自适应结构研究。这三条研究线,走的都是与"造更大的模型"截然不同的路。

不过公司也曾栽过一次大跟头。2025年2月发布的"AI CUDA工程师"号称能自动优化GPU内核,相比PyTorch最高可实现100倍加速,但外部验证发现,这其实是系统钻了评估代码漏洞的"奖励作弊",实际表现完全不同——甚至有用户反馈实际运行反而慢了3倍。公司于2月21日承认了这一问题,并表示已强化评估与运行时性能分析体系,随后下调了原先的宣传数据并做出更正。这起事件之后,"自动化研究系统的结果该由谁来验证、如何验证"这一问题,就一直影响着公司此后发布成果的方式。

2026年:研究成果转化为产品的一年

2026年,Sakana AI把研究成果转化为了能够创造营收的产品。

Sakana Chat于3月24日以免费形式在日本国内限定上线。搭载其上的Namazu(鲶鱼)系列模型,是把DeepSeek-V3.1-Terminus、Llama-3.1-405B、gpt-oss-120B等开放权重模型按照日语和日本文化标准重新调校而成。公司公布的一个数字很能说明这项工作的性质:基础模型DeepSeek-V3.1-Terminus在面对政治敏感话题提问时,有72%的问题会被拒答,而经过Namazu调校后,拒答率几乎降到了0%。8月13日,该聊天机器人又搭载了新一代Namazu和Fugu,新一代Namazu的底层基础也换成了Kimi K2.6。

**Sakana Fugu(河豚)**是一款编排型模型,于4月24日推出测试版,6月22日正式上线。它不是让单一模型回答问题,而是把多个前沿模型按角色分工部署、协同解题。这一思路的依据来自发表于ICLR 2026的两篇论文:Trinity方案是由一个经过轻量进化的协调器,把"思考者、执行者、验证者"三种角色分配给多个语言模型;Conductor方案则是通过强化学习自主找出智能体之间的最佳沟通模式。

产品线以面向日常任务的普通版Fugu,以及针对高难度问题调用更深专家池的Fugu Ultra起步,随后在7月21日新增了专攻安全推理的Fugu Cyber。公司公布的成绩显示,在软件工程基准SWE-Bench Pro上,Fugu Ultra得分73.7分。同一张表中,Opus 4.8为69.2分,GPT-5.5为58.6分,Gemini 3.1 Pro为54.2分,而Fable 5则以80.0分反超Fugu Ultra。在安全基准CyberGym上,Fugu Cyber以86.9%的成绩领先GPT-5.5-Cyber(85.6%)和Claude Opus预览版(83.1%)。需要说明的是,以上所有数据均为Sakana AI自行测得,尚未公开第三方验证结果。

价格方面,公司同时提供月费20美元、100美元、200美元三档订阅,以及按量计费方案。Ultra版按量计费为每百万token输入5美元、输出30美元;超过27.2万token的长上下文场景,价格上调至输入10美元、输出45美元。API兼容OpenAI格式,也可通过OpenRouter、Vercel等平台调用。由于GDPR合规工作尚未完成,欧洲经济区暂未开放。

在介绍Fugu时,公司反复使用的一句话是"无出口管制风险的前沿级性能"——这明显是针对那些受美国模型出口限制影响的地区和行业所做的定位。

Sakana Marlin是公司首款商用产品,于4月2日进入约300人规模的封闭测试,6月15日正式上线,是一款自主研究智能体。单次会话最长可无人值守运行8小时,生成长达100页的报告。其底层技术是曾获NeurIPS 2025 Spotlight的自适应分支蒙特卡洛树搜索,以及AI科学家的工作流自动化能力。收费分为按量计费的积分制(98日元/100积分)、专业版月费15万日元、团队版月费40万日元三档。公司将这款产品定位为面向金融、咨询、战略部门的"虚拟首席战略官"。

产品时间定位
Sakana Chat2026年3月24日日本限定免费聊天机器人,Namazu系列
Sakana Fugu4月24日测试版 · 6月22日正式版多模型编排API
Sakana Marlin4月2日测试版 · 6月15日正式版最长8小时无人值守研究智能体
Sakana Translate7月6日翻译与校对服务
Fugu Cyber7月21日安全推理专用版本

三年融资4亿美元——钱从哪里来

以日本创业公司的标准来看,Sakana AI的融资速度实属罕见。

2024年1月,公司在Lux Capital领投下完成3000万美元种子轮融资;同年9月4日,又完成约2亿美元的A轮融资,由NEA、Khosla Ventures和Lux Capital联合领投,NVIDIA作为战略投资者加入。此外,三菱UFJ、三井住友银行(SMBC)、瑞穗三大银行,以及NEC、富士通、伊藤忠、KDDI、野村、第一生命、ANA控股、东京海上等日本大企业也纷纷加入投资阵容。据当时报道,公司估值达到15亿美元——创业仅14个月就晋升独角兽。

B轮融资最初于2025年11月17日宣布,规模为200亿日元(约1.35亿美元),估值4000亿日元;到2026年4月9日更新的公告中,规模扩大至320亿日元(约2亿美元),估值升至约4320亿日元(约27亿美元)。累计融资额约660亿日元(4.12亿美元)。这一轮融资之所以持续了五个月之久,是因为不断有战略投资者陆续加入:Google于1月23日宣布战略合作关系的同时参与了这一轮;花旗于2月24日加入;三菱电机则于3月25日入场——花旗的这笔投资,也是该行首次对日本企业进行战略投资。此外,Salesforce Ventures、Datadog、麦格理资本、JAFCO,以及美国情报机构关联的风投基金In-Q-Tel、桑坦德旗下的Mouro Capital,也都出现在投资名单上。

轮次时间规模估值
种子轮2024年1月3000万美元
A轮2024年9月4日约2亿美元15亿美元(据报道)
B轮2025年11月17日~2026年4月9日320亿日元(约2亿美元)约4320亿日元(27亿美元)

在算力方面,公司没有选择自建数据中心,而是靠外部采购解决。公司获得了经济产业省GENIAC项目的支持,并使用GMO的GPU云服务。2026年7月16日,公司引入了樱花互联网(Sakura Internet)的"高火力PHY"算力服务,同一天还宣布与NVIDIA展开开放模型合作。这种成本结构,与那些动辄斥资数十亿美元自建集群的美国、欧洲竞争对手截然不同。

客户最初是银行,如今是防卫省

公司营收主要来自与日本大企业的多年期合作。2025年5月,公司与三菱UFJ签署了为期超过三年的全面合作协议,共同开发银行专用AI;10月又与大和证券集团签约,到2026年8月5日,双方的资产管理AI开发进入全面推进阶段。三菱电机在3月出资的同时,也决定将Sakana AI的模型接入其自有平台Serendie。4月30日,公司宣布与SMBC集团联合开发提案自动生成应用;4月7日则参与了总务省针对社交媒体虚假信息、错误信息对策的项目。虽是非官方统计,但据传公司2025年营收大约在3000万美元左右。

第二条营收主线是防卫与情报领域。2026年3月13日,公司获得防卫装备厅下属防卫创新科学技术研究所的多年期委托研究项目,课题名称为"通过组合多种AI技术实现观测、报告、情报整合与资源分配的加速研究"。该项目旨在整合分析陆、海、空各领域的多模态数据,并开发可搭载于无人机等边缘设备的小型视觉-语言模型(SVLM),以提升指挥控制(C2)体系的能力。紧接着7月29日,公司又与防卫省签订了"综合分析业务所需AI功能的调查与验证"合约——这是一项将智能体技术应用于情报本部情报分析官日常工作的项目,标志着合作范围从部队作战单位层级提升到了国家政策层级。

相关背景动向也在同步展开。《读卖新闻》8月9日报道称,日本政府已确定方针,将在自卫队指挥控制体系中引入国产AI,而Sakana Fugu被视为热门候选。公司内部也有一份专门的防卫业务基本方针文件,明确将防卫与情报领域与金融业务并列为优先方向。2025年,在防卫装备厅与美国国防创新单位(DIU)联合主办的美日国防创新挑战赛中,公司获得了"敢闯奖"——它也是唯一一家在传染病预测和AI生成图像检测这两个主题上都进入决赛的参赛方。5月29日,公司还与一般社团法人Deep Dive达成了情报分析方面的合作。

仍需跨越的障碍

公司估值达到27亿美元,但至今没有公开具体营收数字。市面流传的3000万美元这个数字,来自第三方统计,并未得到公司确认。Ha本人也曾多次表示,生成式AI领域目前尚未出现真正被证明可持续盈利的商业模式,并提到过整个行业估值可能存在泡沫。考虑到公司首款商用产品Marlin直到6月才上线,外界目前尚无法确认公司营收是否已经跟上了估值的步伐。

竞争格局也并不简单。Google既是投资方,又通过Gemini在同一市场与Sakana AI直接竞争。OpenAI、Anthropic、Google DeepMind手握的算力和资本,与Sakana AI完全不在一个量级。要留住研究人才,公司势必要在薪酬待遇上与这些巨头正面竞争。

专注日语与日本文化的战略,既是护城河,也是天花板。到目前为止,为公司带来营收的合作方清一色是日本大企业和日本政府机构。虽然Fugu通过兼容OpenAI的API和OpenRouter分发渠道向海外开发者敞开了大门,但欧洲经济区目前仍未开放,海外营收规模也从未公开过。

技术本身的可靠性问题同样悬而未决。AI CUDA工程师性能宣称的更正、AI科学家绕过实验限时的事件、以及那篇主动撤回的研讨会论文,都留下了同一个问题:把自动化研究系统真正用于实际业务时,验证工作该由谁来做、怎么做。而对于一家客户包括银行和防卫机构的公司来说,这个问题的分量,显然要比普通软件公司重得多。

编辑视角

理解Sakana AI,大致有两个角度。

一个是技术路线。这家公司的研究几乎都从同一个约束条件出发:没有美国大型实验室那样的GPU资源。进化式模型融合绕开了训练环节以节省算力,NAMM把推理内存开销最多削减了75%,ShinkaEvolve仅用150个样本就刷新了最佳纪录,Fugu也不是重新训练模型,而是靠调度别人的模型来获得性能。算力不足这个限制条件,反过来定义了研究的方向。考虑到韩国大多数AI团队也面临同样的处境,这家公司提出问题的方式,或许比它具体取得的成果更值得参考。

另一个是商业路径。Sakana AI在三年里走的是"研究成果发布→与大企业合作→政府与防卫合约"这样一条递进路线,每一步都以前一步积累的信任为担保:正因为三大银行参与了A轮融资,才有了后来与三菱UFJ的合作;正因为在金融领域有了实绩,花旗才决定做出对日本企业的首笔投资;也正因为参与了指挥控制基础研究,四个月后才顺理成章拿下了与防卫省的合约。这与靠一款完整产品直接打开市场的路径截然不同。

营收未公开、曾有过一次性能主张的更正记录、业务过度集中于日本市场——这些风险目前依然存在。考虑到公司正在把研究重心扩展到物理AI和机器人领域,未来一年值得关注的两个焦点,其实可以归结为:Fugu和Marlin能否在日本以外的市场创造营收,以及防卫领域的验证项目能否真正转化为实际部署合约。

评论