METAL LAB

AI设计蛋白质 预测与实验结果出现分歧

Claude设计的1320个结合蛋白中,354个成功结合靶点,15个靶点中命中14个。在人类竞赛命中率仅3.7%的靶点上,AI拿到了40%,但在制造之前挑出真正能结合的设计,依然是个难题。

AI设计蛋白质 预测与实验结果出现分歧

图片:由 METAL LAB 生成

摘要

  • Claude自主设计的1320个迷你蛋白结合体中,354个成功结合,命中率达26.8%,而常规项目通常只有10%到15%。
  • 后续分析发现,10种结构预测模型的AUC只有0.55到0.75,不少被记为"结合失败"的案例其实是"表达失败"。

造出1320个,拿去实测有没有黏上

AI设计的蛋白质在实验室里到底能不能真的结合靶点、又能不能在动手合成之前就把会结合的挑出来——这个问题这次有了正面的答案。答案来自Anthropic公开的一次自主蛋白质结合体设计项目,以及后续对这批数据的深入分析。

先看规模。Claude设计的1320个迷你蛋白结合体被拿去对15个靶点做测试,354个成功结合,命中率26.8%。

Anthropic表示,当今蛋白质设计项目的常规命中率通常在10%到15%之间。这次的数字几乎是两倍。

结合体是专门设计出来、能够黏附在靶点蛋白上的小蛋白质。因为体积远小于抗体,所以也被称为迷你结合体。

项目原本挑选了16个靶点,但其中一个因为靶点本身发生聚集、无法判定结果而被剔除。剩下的15个靶点中,有14个成功产出了结合体。

玻璃小瓶密密麻麻地插在网格架上,大多数是空的,只有几个装有液体。
图片:METAL LAB 生成

单靶点、给24小时的方式成绩最好

项目采用了两种运行方式。一种是同时接手多个靶点、给48小时的方式,其中Mythos预览版命中率26.7%,Opus 4.8命中率22.6%。另一种是每次只处理一个靶点、给24小时的方式,Mythos预览版的命中率一路升到35.1%。

投入的算力也公开了。多靶点方式最多用了12500个H100小时,墙钟时间48小时;单靶点方式每个靶点最多用2500个H100小时,墙钟时间24小时。在这个范围内,token数量和子代理数量都没有设上限。

人类介入的部分很少。Anthropic表示,给出最初指令之后,人类做的只是批准访问权限、监控基础设施而已。Claude掌握着互联网访问权限、资料库、谷歌云端硬盘、Slack、Gmail、bioRxiv连接器以及GPU,自行把结构设计、序列设计和共折叠模型串联起来运行。

有靶点的成绩超过了人类竞赛纪录

按靶点分开看,差距非常大——而这种差距,恰恰是这次项目里最值得关注的地方。

在RBX1这个靶点上,命中率达到40%。而在此前针对同一靶点举办的公开竞赛中,人类参赛者的命中率只有3.7%。

排名最高的设计,结合力比竞赛冠军作品还要强。代表结合强度的KD值从25.7纳摩尔降到了3.9纳摩尔——KD值越小,代表结合得越紧密。

在15-PGDH这个靶点上,此前最好的成绩是1.7微摩尔,这次降到了33.4纳摩尔,相当于提升了五十多倍。TREM2靶点的命中率升到了80%,而此前竞赛中的成绩只有38.3%。

但也有失败的例子。在MBP靶点上,总共设计了90个,却一个结合体都没有出来。在TNFα靶点上,Opus 4.8成功了,Mythos预览版却失败了,Anthropic在报告中如实写下:不清楚原因。

整体来看,至少有6个靶点产出了KD值低于10纳摩尔的高亲和力结合体,至少有4个靶点的成绩追平或超过了此前报告过的最高亲和力纪录。

靶点Claude命中率对比基准最佳结合强度(KD)
TREM280%此前竞赛38.3%
RBX140%人类竞赛3.7%25.7nM → 3.9nM
15-PGDH1.7µM → 33.4nM
MBP0%(设计90个)无结合体
总计26.8%(1320个中354个)常规项目10%~15%15个靶点中14个成功结合

表格之外的靶点数据,共同构成了26.8%这个总体数字。表现好与表现差的靶点之间的这道落差,才是这次项目里信息量最大的部分。

实验室里95%的设计都成功制造了出来

验证工作由Adaptyv Bio和Twist Bioscience两家机构独立完成。Adaptyv Bio公开的案例研究中详细记录了实验方法。

设计出的氨基酸序列先被转换成DNA并自动合成,再通过无细胞蛋白质合成方式和机器人移液技术制成蛋白质。结合情况用表面等离子体共振技术测量,在五个靶点浓度下各重复测量两次。

这里有个值得注意的数字:表达率。95%的设计确实成功制造出了蛋白质,与竞赛最高水平持平。这说明AI给出的序列并不是实验室难以处理的“怪东西”。

同一间房里并排放着两张一模一样的实验台,各自摆着相同的设备。
图片:METAL LAB 生成

但在制造之前挑出好设计,是另一回事

对这批数据展开的后续分析,提出了一个不同的问题:在真正动手合成之前,能不能靠计算机打分把会结合的设计和不会结合的设计区分开?

把10种结构预测模型套用到同一批数据上后发现,AUC值散布在0.55到0.75之间。AUC指的是,随机挑一个结合体和一个非结合体,模型给结合体打出更高分数的概率——0.5相当于抛硬币,1.0则是完美预测。如果想把某个预测器当作唯一的筛选标准来用,AUC至少要接近0.9,而实际数字远低于这个门槛。

把多个预测器组合起来也没能改变这个性质。综合排名平均后得到的共识分数表现最好,AUC为0.75,单一最佳预测器为0.73——集成方法只是略微把结果往上推了一点。

挑选方式AUC
排名平均共识0.75
单一最佳预测器0.73
中位数共识0.73
一致共识0.72
仅用表达量0.60~0.65
参考:作为单一筛选标准所需0.9

真正的价值体现在别的地方。如果预算只够合成50个设计,用共识分数来挑选,命中率会比随机挑选高出大约1.5倍。它当不了一刀切的筛选门槛,但用来排序还是有用的。

而且,不少被记录为"结合失败"的案例,实际上是"表达失败"。结合体的表达量中位数约为2.0mg/mL,而非结合体约为0.5mg/mL。仅凭表达量这一项数据来判断是否结合,AUC也能达到0.60到0.65。蛋白质本身没能正确制造出来的话,结合实验根本无从谈起,但在结果表里,这些情况却被直接记作了"失败"。

两家实验室的判定结果也时常不一致。衡量一致程度的科恩卡帕系数在0.40到0.50之间,两家机构测出的KD值中位数相差约2.2倍。如果连"标准答案"本身都带着噪声,任何预测器都不可能超越这个上限。

编辑视角

这次项目里最该被放大看的数字,不是26.8%,而是3.7%——相差十倍以上。长期以来,蛋白质设计被认为是一件需要大量熟练人才才能做好的事,这个前提在这里被动摇了。

但与此同时,MBP的案例不能被忽略。90个设计,一个结合体都没出来。在TNFα靶点上,一个模型成功而另一个失败,Anthropic如实写明了自己也不清楚原因。

在成绩单里不抹去失败案例的做法,并不常见。正是这两行如实记录,提升了其余数字的可信度。

我们昨天的报道讲的是速度——24小时内完成设计并成功结合。而这次公布的整个项目数据,让画面变得不一样了。比速度更重的事实是:有多个靶点的成绩超过了人类竞赛纪录。

从实操角度看,后续分析反而更有用。它给出了三条建议:先用表达量做初筛;不要只信一个预测器,应该把多个排名综合起来;评估成绩时要按靶点分开看。这三条不需要换用新模型,今天就能直接应用。

尤其是"表达失败会伪装成结合失败"这一点,值得国内生物团队立刻去核实。过去积累的不少AI蛋白质设计成绩单,很可能都没有做这层区分就直接统计了。这意味着,一部分归咎于模型的失败,实际上出在制造环节。

Anthropic自己也划清了边界:要确定命中率和亲和力的最终数值,还需要更全面的性质分析;迷你结合体并非标准治疗形式;高亲和力结合体也只是新药研发的第一步。

不过,这次项目划出的分界线是清楚的:AI蛋白质设计已经过了"能不能造出来"这个阶段。下一步的问题是"该选什么去造",而这些数字共同说明,这个挑选环节目前仍然掌握在人类手里。

评论