每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Inherent,270亿参数模型Faraday超越Anthropic、OpenAI

这家由谷歌DeepMind出身团队创立的伦敦初创公司,用一个体型小得多的模型,在论文复现任务上击败了前沿模型

화이트보드 앞에서 팀원 네 명이 함께 있는 모습

이미지: TechCrunch AI

摘要

  • 伦敦初创公司Inherent发布的AI智能体Faraday,在论文复现任务中表现优于Anthropic的Claude Opus 4.8和OpenAI的GPT-5.5。
  • Faraday基于270亿参数的Qwen 3.6打造,体型远小于用来对比的两款模型。
  • Inherent在获得5000万美元种子融资、结束隐身模式仅数周后就拿出了这一成果,并计划到年底将团队规模扩大到20到25人。
회사
Inherent (런던, 구글 딥마인드 출신 설립)
에이전트
Faraday
기반 모델
Qwen 3.6, 270억 파라미터
비교 대상 모델
앤스로픽 Claude Opus 4.8, 오픈AI GPT-5.5
시드 투자
5000만 달러 (스텔스 탈피 시 공개)
직원 수
12명 → 연말 20~25명 목표
공동창업자
Edward Hughes, Louis Kirsch, Kaloyan Aleksiev, Tantum Collins

小模型战胜大模型的说法

由谷歌DeepMind出身团队在伦敦创立的初创公司Inherent宣布,他们自主研发的AI智能体在某项任务上超越了AnthropicOpenAI的前沿模型。这项任务是要求AI在不预先获知答案的情况下,自行复现已发表科学论文中的实验结果。据Inherent介绍,这款名为Faraday的智能体,表现好于Anthropic的Claude Opus 4.8和OpenAI的GPT-5.5——而这两款都是规模大得多的前沿级系统,这一结果因此格外引人注目。

更值得关注的是驱动Faraday的模型体量。根据Inherent自己发布的研究页面,Faraday基于一个相对较小的模型——参数量为270亿的Qwen 3.6。参数量通常被视为衡量模型规模和训练成本的指标,而众所周知,前沿级模型的参数规模一般要大得多。

Inherent是一家怎样的公司

在众多由谷歌DeepMind出身团队创立的初创公司中,Inherent此前算是相对低调的一家。当那些融资规模更大的竞争对手还没能拿出具体成果时,这支团队已经开始陆续公布结果。就在获得5000万美元种子轮融资、结束隐身状态仅仅几周之后,他们就交出了这次的Faraday成果。

联合创始人兼首席科学官Edward Hughes承认,论文复现这件事听起来可能像是耍花招,但他解释说,这项任务其实和人类科学家的标准训练过程并无二致。"大多数博士生都是从这里起步的。"他表示,Inherent的最终目标不止于验证已有成果,而是要打造一个能够发现全新科学知识的AI。

比起赢,更看重怎么赢

Hughes表示,击败其他AI系统本身并不是目标,真正重要的是达成这一结果的方式。Inherent设定的成功标准也不只是准确度那么简单。除了要求准确复现结果,他们还希望Faraday具备判断哪些实验值得一试、以及如何设计好这些实验的直觉——Inherent将这种能力称为"研究品味"(research taste)。

这种直觉很难靠一条条规则去教会。Inherent为此采用了强化学习:只要结果好就给予奖励。他们的判断是,与其直接训练科研过程本身,不如让基于结果的奖励学习方式在不同科学领域间更好地泛化。Hughes说:"我们始终被打造具备研究品味的AI科学家智能体这一北极星目标所吸引。"

这一原则也决定了Inherent不去做什么。他们没有自主开发编程工具,而是直接让Faraday调用OpenAI的GPT-5.5 Codex。公司方面解释说,这就像人类科学家一样,不会事事都自己造工具,而是善用现成的软件。

国王十字车站办公室与"花园休假"难题

Inherent的12名员工全部在伦敦国王十字车站的办公室现场办公。这一带曾经相对破旧,如今随着谷歌DeepMind的入驻,已经变成全球AI重镇之一。Hughes表示:"我相信伦敦就该是这个样子。"

与此同时,Hughes也公开支持取消英国常见的"花园休假"(garden leave)制度——即离职员工在数月内不得加入竞争对手或自行创业。批评者指出,美国的研究人员大多不受此类限制,这使得美国初创公司在人才争夺上占据优势。他在个人X账号发文中表示:"这只是我的个人看法,不代表公司立场,但我自己确实曾因'花园休假'制度而吃过苦头。"

最终,Hughes摆脱了这一限制,与另外两位谷歌DeepMind出身的伙伴以及第四位联合创始人一起创立了Inherent。公司表示无意放慢脚步,计划到年底将团队规模扩大至20到25人。鉴于公司在世界模型领域也怀有野心,有观点认为,在Demis Hassabis新职位引发内部震动之际,Inherent或将成为谷歌DeepMind员工颇具吸引力的跳槽去处。

模型规模对比

系统开发方特点
Faraday(基于Qwen 3.6)Inherent270亿参数,专攻论文复现任务
Claude Opus 4.8Anthropic前沿级,参数量未公开
GPT-5.5OpenAI前沿级,参数量未公开

编辑视角

这次发布真正值得关注的,不是"赢了"这个结果本身,而是"用小模型赢了"这个组合。AI行业这些年一直朝着更大模型、更多算力的方向推进性能提升,而Inherent却反其道而行之拿出了成果。一个270亿参数的模型能够击败前沿级系统,这释放出一个信号:把问题设计好、把训练做对,可能比单纯堆规模更重要。

结合近期行业的其他动向来看,这一结果的意味会更清晰。就像英伟达最近展示的案例一样,决定智能体表现的往往不是模型本身,而是包裹模型的那套执行框架——也就是任务如何拆解、配上什么工具。Inherent选择不自研编程工具、直接借用OpenAI的Codex,背后是同一套逻辑:把精力集中在自己擅长的地方,其余部分借用现成方案,反而可能拿到更好的结果。

这对国内AI团队也有实际的启发。如果团队对大模型API的成本感到吃力,一种可行策略是:把任务范围收窄、明确定义,再针对这个具体任务用强化学习去打磨一个小模型,这或许比直接调用前沿模型更划算。不过需要说明的是,这次的成果仅限于论文复现这一狭窄任务,Inherent自己也承认,真正发现全新科学结论是难度大得多的下一步。

接下来几个月的关键,是Inherent能否跳出这一狭窄任务,真正自主设计并提出全新的实验结果。到那时,"研究品味"这个说法究竟是营销话术,还是真本事,才会见分晓。

评论