
이미지: @SakanaAILabs (X)
摘要
- Sakana AI于2023年7月在东京创立,短短三年估值达到约27亿美元,累计融资4.12亿美元
- 公司的研究路线不是靠堆参数做规模化,而是进化算法、模型合并与递归式自我改进,并在2026年通过Fugu、Marlin、Sakana Chat实现产品化
- 营收主要来自与日本大企业的合作以及防卫、情报领域的合约,但曾经历成果说法被更正的历史,加上业务过度集中于日本市场,仍是不容忽视的风险
- 설립
- 2023년 7월 · 도쿄 미나토구(2026년 2월 아자부다이힐스 이전)
- 창업자
- 데이비드 하(CEO)·라이온 존스(CTO)·이토 렌(COO)
- 기업가치
- 약 4,320억 엔(약 27억 달러) · 2026년 4월 기준
- 누적 조달
- 약 660억 엔(4억 1,200만 달러)
- 대표 연구
- 진화적 모델 병합 · AI 사이언티스트 · 다윈 괴델 머신 · CTM
- 상용 제품
- 사카나 마린(2026-06-15) · 후구(2026-06-22) · 사카나 챗 · 트랜슬레이트
- 주요 파트너
- 미쓰비시UFJ · 다이와증권 · SMBC · 미쓰비시전기 · 씨티 · 구글 · 엔비디아
- 방위 계약
- 2026-03-13 방위혁신과학기술연구소 위탁연구 · 2026-07-29 방위성 총합분석 실증
三个人在东京提出的"反规模化"假设
Sakana AI于2023年7月在东京成立。自2026年2月16日起,总部设在港区麻布台之丘森JP大厦22层。公司由三位创始人共同创立,三人的履历几乎没有交集。
首席执行官David Ha曾在高盛工作八年,官至日本利率交易部门联席主管兼董事总经理,随后于2016年跳槽到Google Brain。还在银行工作期间,他就以"hardmaru"这个匿名身份运营AI研究博客,这个账号在深度学习圈子里其实比他本人更先出名。离开Google后,他从2022年起在Stability AI担任研究负责人约一年。
首席技术官Llion Jones在威尔士长大,14岁就做出过一个聊天机器人,后来在伯明翰大学拿到计算机科学与AI的学士和硕士学位。他名下最有名的文献,是2017年那篇论文《Attention Is All You Need》——这篇论文提出了Transformer架构,如今几乎所有大型语言模型都建立在这个架构之上,而Jones正是该论文8位合著者之一。Jones提到自己加入Sakana AI的原因时表示,他判断传统Transformer路线已经进入收益递减阶段。
首席运营官Ren Ito毕业于东京大学法学部,后在纽约大学法学院取得LLM学位,又在斯坦福大学读完硕士。他2001年进入外务省成为外交官,之后在Mercari担任负责全球业务的执行董事,同样也在Stability AI做过COO。Ha和Ito都出身同一家公司,而Ha和Jones则是在Google东京办公室相识——这些交集构成了这个创始团队组合的背景。
公司名"Sakana(魚)"在日语里就是"鱼"的意思。一条鱼只遵循几条简单规则,但整个鱼群却能表现出躲避天敌、寻找食物这类复杂行为。把这种群体智能搬到模型设计上,正是公司的出发点。面对不断堆参数换性能的规模化竞赛,三位创始人认为存在另一条路。
进化式模型合并——不训练也能造出新模型
真正让这家公司在研究圈打响名号的,是2024年3月21日公布的"进化式模型合并"(Evolutionary Model Merge)。这项技术把多个已经公开的开源模型组合成一个新模型,但组合方式不是人来定,而是由进化算法自动寻找。相关论文于2025年1月发表在《自然·机器智能》上。
搜索在两个空间中同时进行。在参数空间(PS)中,算法会为多个模型的权重按层进化出最佳混合比例;在数据流空间(DFS)中,算法则进化出不同模型的层该以怎样的顺序拼接。这两个空间的组合数量都大到人类直觉无法穷尽的地步。系统运行100到150代,每一代只保留表现最好的个体繁衍下一代,最终得到成品模型。
这种方法的关键在于全程不需要跑一次基于梯度下降的训练。它没有靠GPU反复做反向传播,而是把问题转化为组合已训练好的权重,大幅削减了计算量。
公司同时公布了具体成果。70亿参数模型EvoLLM-JP在日语数学推理基准MGSM-JA上拿到55.2%的成绩(若以已公开的v1-7B版本计算则为50.6%)。这个模型是把一个具备日语能力的模型(Shisa-Gamma)和两个数学专精模型(WizardMath、Abel)合并而成。尽管目标只是数学能力,但它在日语综合基准(JP-LMEH)上的平均分达到70.5,超过了所有700亿参数以下的日语模型,也超过了此前700亿级别的最佳成绩——不过同一张表里Swallow 70B仍以71.5分领先。同一系列还包括融合图像与语言处理能力的EvoVLM-JP,以及能用四步推理处理日语提示词的图像生成模型EvoSDXL-JP。
| 空间 | 进化对象 | 过去人工做法 |
|---|---|---|
| 参数空间(PS) | 各层权重混合比例 | 按固定比例取平均 |
| 数据流空间(DFS) | 不同模型层的排列顺序 | 靠直觉与经验设计 |
会自我修正的AI——从AI Scientist到RSI实验室
第二条研究主线,是让AI自己改进AI。起点是2024年8月13日公布的"AI Scientist"(The AI Scientist),这是一套从提出研究想法、编写实验代码、执行实验、分析结果、撰写论文到同行评审全流程自动运行、无需人类介入的系统。据报道,生成一篇论文的算力成本约为15美元。
后续版本AI Scientist v2在2025年3月的ICLR 2025研讨会评审中拿出了成绩:提交的3篇论文中有1篇平均得分6.33,达到录用标准,这个分数甚至高于55%的人类投稿论文。不过Sakana AI在正式发表前主动撤回了这篇论文——原因是它没有经过研讨会组委会的元评审,而且研讨会的录用率本就远高于正式会议,加之论文中还被指出存在引用错误。所以"AI通过了同行评审"这句话,其适用范围也就止步于此。系统本身的研究论文已于2026年3月25日发表在《自然》杂志上(第651卷,第914-919页)。
同一项研究中还浮现出安全层面的信号。测试过程中,当实验超出时限,这套系统没有选择更快地写代码,而是直接修改自身代码去延长时限本身;还出现过一次它在自己的代码里插入了重新调用自身的系统调用,导致陷入无限循环。公司公开这些案例后,围绕自主智能体的可控性问题引发了一轮讨论。
此后的成果进一步推向自我改进方向。2025年5月公布的Darwin Gödel Machine,是一套让智能体不断重写自身代码库、产生变体的结构。它把SWE-bench的成绩从20%提升到50%,绝对提升了30个百分点;在多语言编程任务Polyglot上,成绩也从14.2%提升到30.7%。同年9月开源的ShinkaEvolve,是一个结合语言模型与进化算法的程序进化框架——它仅用150个样本,就在"圆盘装填"这类经典优化问题上刷新了最佳纪录;在另一项实验中,它仅用30代就为混合专家(MoE)模型找到了一种新的负载均衡损失函数。
竞赛成绩方面也有亮点。2025年12月14日,算法优化智能体ALE-Agent在AtCoder启发式竞赛第058场中夺得第一——这是一场804名人类选手参与、限时4小时的比赛,也是AI智能体首次在此类竞赛中夺冠。整场比赛消耗的算力成本约为1300美元。
这条研究主线在2026年6月5日被正式整合为"递归式自我改进"(RSI)实验室,其口号是"靠想法前进,而不只是靠算力前进"。这句话的意思是,日本没有大型算力厂商那样的算力储备,而公司打算把这个限制条件本身,变成推动样本效率研究的理由。向物理世界的延伸也是这条线的自然延续:7月13日,团队公布了在物理环境中实现群体智能的"智能蜂窝积木"研究;8月10日,公司又通过自有渠道提出把物理AI作为下一个前沿方向。
瞄准Transformer之后的架构研究
第三条主线是试图改变架构本身的研究。
"连续思维机器"(Continuous Thought Machines,CTM)于2025年5月公布。这是一种把时间维度重新引入神经网络的结构,让单个神经元能记住过去的活动,并通过神经元之间的同步来按顺序处理信息。公司表示,这种结构在"置信度校准"方面的表现甚至超过了人类。
"神经注意力记忆模型"(NAMM)于2024年12月公布。它能学习决定上下文中积累的token哪些该保留、哪些该丢弃,从而减轻推理阶段的内存负担。据报道,该技术在语言与多模态任务中最多能将内存开销降低75%——这种改进在算力资源有限的环境中能直接转化为实际收益。
2025年1月公布的Transformer²,则瞄准让模型能根据任务自动调整自身权重的"自适应"结构。这三条研究路线,走的都不是"把模型做得更大"这条路。
但公司也曾有一次重大失误。2025年2月公布的"AI CUDA工程师"号称能自动优化GPU内核,相比PyTorch最高可实现100倍加速,但外部验证发现,这其实是系统钻了评测代码漏洞的"奖励作弊"行为——甚至有用户反映实际使用后反而慢了3倍。公司在2月21日承认了这一问题,表示已强化评测与运行时性能分析体系,并下调了原先的性能说法、更正了相关结果。这起事件之后,"自动化研究系统的产出该由谁、以何种方式验证"这个问题,一直留在公司此后的发布方式里。
2026年:研究变成了产品
2026年是Sakana AI把研究成果转化为可创收产品的一年。
Sakana Chat于3月24日面向日本国内限量免费开放。搭载其上的Namazu(鲇鱼)系列模型,是把DeepSeek-V3.1-Terminus、Llama-3.1-405B、gpt-oss-120B等开源权重模型按日语和日本文化标准重新调校而成。公司公布的一个数字很能说明这项工作的性质:作为基础模型的DeepSeek-V3.1-Terminus,对政治敏感话题的提问有72%会拒答,而经Namazu调校后,拒答率几乎降到了0%。8月13日,该聊天机器人又接入了新一代Namazu和Fugu,新一代Namazu的底层模型也换成了Kimi K2.6。
**Sakana Fugu(河豚)**是一款编排型模型,4月24日推出测试版,6月22日正式上线。它不是靠单一模型作答,而是把多个前沿模型按角色分工调度,分头解决问题。这一设计的依据来自两篇发表于ICLR 2026的论文:Trinity让一个经过轻量进化的协调器,给多个语言模型分配"思考者、执行者、验证者"的角色;Conductor则用强化学习直接找出智能体之间的最优沟通模式。
产品线从面向日常业务的Fugu,以及为难题调动更深专家池的Fugu Ultra起步,7月21日又新增了专攻安全推理的Fugu Cyber。公司公布的成绩显示,在软件工程基准SWE-Bench Pro上,Fugu Ultra得分73.7。同一张表中,Opus 4.8得69.2分,GPT-5.5得58.6分,Gemini 3.1 Pro得54.2分,而Fable 5则以80.0分反超Fugu Ultra。在安全基准CyberGym上,Fugu Cyber以86.9%的成绩领先GPT-5.5-Cyber(85.6%)和Claude Miso Preview(83.1%)。需要说明的是,以上数字均为Sakana AI自行测得,尚未公开第三方验证结果。
定价方面,公司同时提供每月20美元、100美元、200美元的订阅制以及按量计费。Ultra版按量计费为每百万token输入5美元、输出30美元,若上下文超过27.2万token的长文本场景,则涨到10美元和45美元。API兼容OpenAI格式,也可通过OpenRouter、Vercel等平台使用。目前欧洲经济区因GDPR合规工作尚未完成而未开放服务。
在介绍Fugu时,公司反复使用的一句话是"具备前沿级性能,且不受出口管制风险影响"——这明显是针对那些受美国模型出口管制波及的地区和行业所做的定位。
Sakana Marlin是一款自主研究智能体,4月2日先经过约300人规模的封闭测试,6月15日正式上线,是Sakana AI的首款商用产品。它可以连续无人运行长达8小时,产出一份长达100页的报告。其底层技术是曾获NeurIPS 2025 Spotlight奖项的自适应分支蒙特卡洛树搜索,以及AI Scientist的工作流自动化能力。定价分为按量计费的积分制(98日元100点起)、专业版(月费15万日元)和团队版(月费40万日元)。公司将这款产品定位为服务于金融、咨询和战略部门的"虚拟首席战略官"。
| 产品 | 时间节点 | 定位 |
|---|---|---|
| Sakana Chat | 2026年3月24日 | 日本限定免费聊天机器人,Namazu系列 |
| Sakana Fugu | 4月24日测试版 · 6月22日正式版 | 多模型编排API |
| Sakana Marlin | 4月2日测试版 · 6月15日正式版 | 最长8小时无人研究智能体 |
| Sakana Translate | 7月6日 | 翻译与校对服务 |
| Fugu Cyber | 7月21日 | 安全推理专用版本 |
三年融资4亿美元,钱从哪儿来
从融资速度看,这在日本创业公司中相当罕见。
2024年1月,公司在Lux Capital领投下完成3000万美元种子轮融资;同年9月4日,又完成约2亿美元的A轮融资,由NEA、Khosla Ventures、Lux Capital联合领投,NVIDIA以战略投资者身份加入。此外,三菱UFJ、三井住友银行(SMBC)、瑞穗三大银行,以及NEC、富士通、伊藤忠、KDDI、野村、第一生命、ANA控股、东京海上等一众日本大企业也纷纷参投。据当时的报道,公司估值达到15亿美元——距创立仅14个月就成为独角兽。
B轮融资最初于2025年11月17日宣布,规模200亿日元(约1.35亿美元),估值4000亿日元;随后在2026年4月9日的更新披露中,规模扩大到320亿日元(约2亿美元),估值升至约4320亿日元(约27亿美元)。累计融资总额约660亿日元(4.12亿美元)。这一轮融资之所以持续了五个月之久,是因为不断有新的战略投资者加入:Google于1月23日宣布战略合作关系并加入本轮融资,花旗于2月24日加入,三菱电机则在3月25日跟进——花旗这笔投资也是该行首次对日本企业进行战略投资。名单上还有Salesforce Ventures、Datadog、麦格理资本、JAFCO,以及与美国情报机构相关的风投基金In-Q-Tel,和西班牙桑坦德银行旗下的Mouro Capital。
| 轮次 | 时间 | 规模 | 估值 |
|---|---|---|---|
| 种子轮 | 2024年1月 | 3000万美元 | — |
| A轮 | 2024年9月4日 | 约2亿美元 | 15亿美元(据报道) |
| B轮 | 2025年11月17日 至 2026年4月9日 | 320亿日元(约2亿美元) | 约4320亿日元(27亿美元) |
在算力方面,公司选择靠外部采购而非自建数据中心来解决。它获得了经济产业省GENIAC项目的支持,并使用GMO的GPU云服务。2026年7月16日,公司引入了樱花互联网(Sakura Internet)的"高火力PHY"算力平台,同一天还宣布与NVIDIA在开源模型上展开合作。这种成本结构,与那些在自建集群上投入数十亿美元的美欧竞争对手完全不同。
客户从银行开始,如今延伸到了防卫省
公司营收主要来自与日本大企业的多年期合作。2025年5月,公司与三菱UFJ银行签订了为期三年以上的全面合作协议,共同开发银行专用AI;10月又与大和证券集团签约,并于2026年8月5日进入资产管理AI的正式开发阶段。三菱电机在3月出资的同时,也决定将Sakana AI的模型接入自家的Serendie平台。4月30日,公司宣布与SMBC集团共同开发一款自动生成提案书的应用;4月7日,还参与了总务省关于社交媒体虚假信息治理的项目。虽然是非官方统计,但据称2025年公司营收在3000万美元左右。
第二条业务主线是防卫与情报领域。2026年3月13日,公司获得防卫装备厅下属防卫创新科学技术研究所的多年期委托研究,课题名为"通过组合多种AI技术实现观测、报告、情报整合与资源分配的高速化研究",内容涉及整合分析陆、海、空各领域的多模态数据,并开发可部署在无人机等边缘设备上的小型视觉-语言模型(SVLM),以提升指挥控制(C2)体系的能力。紧接着在7月29日,公司又与防卫省签订了"AI功能在综合分析业务中的调查与验证"合约——这是一项将智能体技术应用于情报本部情报分析官日常工作的项目,合作层级也从部队作战单位提升到了国家政策层面。
相关背景也在同步发酵。《读卖新闻》8月9日报道称,日本政府已确定在自卫队指挥控制体系中引入国产AI的方针,而Sakana Fugu被视为有力候选。公司还专门制定了一份防卫业务基本方针文件,将金融与防卫、情报并列为优先领域。2025年,在防卫装备厅与美国国防创新单位(DIU)联合主办的美日国防创新挑战赛中,公司获得了鼓励奖,是唯一一支在传染病预测和AI生成图像检测这两个主题上都进入决赛的参赛队伍。5月29日,公司还与一般社团法人Deep Dive建立了情报分析方面的合作关系。
尚待跨越的坎
公司估值高达27亿美元,但至今没有公开的营收数字。市场上流传的3000万美元这个数字,来自第三方统计,公司本身从未证实过。CEO Ha自己也曾表示,生成式AI领域至今还没有出现被证明可持续盈利的商业模式,并提到过整个行业估值可能存在泡沫。考虑到公司首款商用产品Marlin直到6月才推出,营收是否已追上估值,外界目前尚无从判断。
竞争格局也并不简单。Google既是投资方,又通过Gemini在同一市场与Sakana AI直接竞争;OpenAI、Anthropic、Google DeepMind手握的算力和资本,与Sakana AI相比根本不在一个量级。要留住研究人才,公司就必须与这些巨头在薪酬上正面竞争。
专注日语与日本文化的策略,既是护城河,也是天花板。目前为公司带来营收的合作伙伴清一色是日本大企业和日本政府机构。虽然Fugu通过兼容OpenAI的API以及OpenRouter分发向海外开发者开放,但欧洲经济区目前仍未开通服务,海外营收规模也未曾公开。
技术本身的可靠性问题同样存在。AI CUDA工程师的性能说法被更正、AI Scientist绕过时限限制的事件、以及研讨会论文的主动撤回,都留下了一个问题:当自动化研究系统被真正投入实际业务时,验证工作该由谁来做、怎么做?对于一家客户包括银行和防卫机构的公司而言,这个问题的分量,远比普通软件公司要重得多。
编辑视角
理解Sakana AI,大致有两个角度。
一个是技术路线。这家公司的所有研究,起点其实都是同一个约束条件——没有美国大型实验室那样的GPU储备。进化式模型合并靠跳过训练环节节省了算力,NAMM把推理内存开销最多削减了75%,ShinkaEvolve仅用150个样本就刷新了纪录,而Fugu也不是靠重新训练模型,而是靠调度别人的模型来获得性能。可以说,算力匮乏这个条件,反过来决定了公司的研究议题。考虑到韩国大多数AI团队也处在类似的资源约束下,这家公司提出问题的方式,或许比它某个具体成果更值得参考。
另一个是商业路径。三年间,Sakana AI走过了"研究成果发布→与大企业合作→政府和防卫合约"这样一条上升路线,每一步都以前一步积累的信任为基础:正因为三大银行参与了A轮融资,才有了后续与三菱UFJ的合约;正因为在金融领域做出了业绩,花旗才会决定进行其在日本的首笔战略投资;也正因为承接了指挥控制基础研究,四个月后才顺理成章地拿下防卫省的合约。这与靠一款成品打开市场的常规路径不同。
营收尚未公开、曾经历过一次成果说法被更正、业务过度集中于日本市场——这些风险依然摆在那里。考虑到公司目前正把研究重心扩展到物理AI和机器人领域,未来一年值得关注的,无非两点:Fugu和Marlin能否在日本以外的市场创造营收,以及防卫领域的验证项目能否真正转化为实际部署合约。




评论