
图片:由 METAL LAB 生成
摘要
- Claude自主设计的1320个迷你蛋白结合体中,354个成功结合,命中率达26.8%,而常规项目通常只有10%到15%。
- 后续分析发现,10种结构预测模型的AUC只有0.55到0.75,不少被记为"结合失败"的案例其实是"表达失败"。
造出1320个,拿去实测有没有黏上
AI设计的蛋白质在实验室里到底能不能真的结合靶点、又能不能在动手合成之前就把会结合的挑出来——这个问题这次有了正面的答案。答案来自Anthropic公开的一次自主蛋白质结合体设计项目,以及后续对这批数据的深入分析。
先看规模。Claude设计的1320个迷你蛋白结合体被拿去对15个靶点做测试,354个成功结合,命中率26.8%。
Anthropic表示,当今蛋白质设计项目的常规命中率通常在10%到15%之间。这次的数字几乎是两倍。
结合体是专门设计出来、能够黏附在靶点蛋白上的小蛋白质。因为体积远小于抗体,所以也被称为迷你结合体。
项目原本挑选了16个靶点,但其中一个因为靶点本身发生聚集、无法判定结果而被剔除。剩下的15个靶点中,有14个成功产出了结合体。

单靶点、给24小时的方式成绩最好
项目采用了两种运行方式。一种是同时接手多个靶点、给48小时的方式,其中Mythos预览版命中率26.7%,Opus 4.8命中率22.6%。另一种是每次只处理一个靶点、给24小时的方式,Mythos预览版的命中率一路升到35.1%。
投入的算力也公开了。多靶点方式最多用了12500个H100小时,墙钟时间48小时;单靶点方式每个靶点最多用2500个H100小时,墙钟时间24小时。在这个范围内,token数量和子代理数量都没有设上限。
人类介入的部分很少。Anthropic表示,给出最初指令之后,人类做的只是批准访问权限、监控基础设施而已。Claude掌握着互联网访问权限、资料库、谷歌云端硬盘、Slack、Gmail、bioRxiv连接器以及GPU,自行把结构设计、序列设计和共折叠模型串联起来运行。
有靶点的成绩超过了人类竞赛纪录
按靶点分开看,差距非常大——而这种差距,恰恰是这次项目里最值得关注的地方。
在RBX1这个靶点上,命中率达到40%。而在此前针对同一靶点举办的公开竞赛中,人类参赛者的命中率只有3.7%。
排名最高的设计,结合力比竞赛冠军作品还要强。代表结合强度的KD值从25.7纳摩尔降到了3.9纳摩尔——KD值越小,代表结合得越紧密。
在15-PGDH这个靶点上,此前最好的成绩是1.7微摩尔,这次降到了33.4纳摩尔,相当于提升了五十多倍。TREM2靶点的命中率升到了80%,而此前竞赛中的成绩只有38.3%。
但也有失败的例子。在MBP靶点上,总共设计了90个,却一个结合体都没有出来。在TNFα靶点上,Opus 4.8成功了,Mythos预览版却失败了,Anthropic在报告中如实写下:不清楚原因。
整体来看,至少有6个靶点产出了KD值低于10纳摩尔的高亲和力结合体,至少有4个靶点的成绩追平或超过了此前报告过的最高亲和力纪录。
| 靶点 | Claude命中率 | 对比基准 | 最佳结合强度(KD) |
|---|---|---|---|
| TREM2 | 80% | 此前竞赛38.3% | |
| RBX1 | 40% | 人类竞赛3.7% | 25.7nM → 3.9nM |
| 15-PGDH | 1.7µM → 33.4nM | ||
| MBP | 0%(设计90个) | 无结合体 | |
| 总计 | 26.8%(1320个中354个) | 常规项目10%~15% | 15个靶点中14个成功结合 |
表格之外的靶点数据,共同构成了26.8%这个总体数字。表现好与表现差的靶点之间的这道落差,才是这次项目里信息量最大的部分。
实验室里95%的设计都成功制造了出来
验证工作由Adaptyv Bio和Twist Bioscience两家机构独立完成。Adaptyv Bio公开的案例研究中详细记录了实验方法。
设计出的氨基酸序列先被转换成DNA并自动合成,再通过无细胞蛋白质合成方式和机器人移液技术制成蛋白质。结合情况用表面等离子体共振技术测量,在五个靶点浓度下各重复测量两次。
这里有个值得注意的数字:表达率。95%的设计确实成功制造出了蛋白质,与竞赛最高水平持平。这说明AI给出的序列并不是实验室难以处理的“怪东西”。

但在制造之前挑出好设计,是另一回事
对这批数据展开的后续分析,提出了一个不同的问题:在真正动手合成之前,能不能靠计算机打分把会结合的设计和不会结合的设计区分开?
把10种结构预测模型套用到同一批数据上后发现,AUC值散布在0.55到0.75之间。AUC指的是,随机挑一个结合体和一个非结合体,模型给结合体打出更高分数的概率——0.5相当于抛硬币,1.0则是完美预测。如果想把某个预测器当作唯一的筛选标准来用,AUC至少要接近0.9,而实际数字远低于这个门槛。
把多个预测器组合起来也没能改变这个性质。综合排名平均后得到的共识分数表现最好,AUC为0.75,单一最佳预测器为0.73——集成方法只是略微把结果往上推了一点。
| 挑选方式 | AUC |
|---|---|
| 排名平均共识 | 0.75 |
| 单一最佳预测器 | 0.73 |
| 中位数共识 | 0.73 |
| 一致共识 | 0.72 |
| 仅用表达量 | 0.60~0.65 |
| 参考:作为单一筛选标准所需 | 0.9 |
真正的价值体现在别的地方。如果预算只够合成50个设计,用共识分数来挑选,命中率会比随机挑选高出大约1.5倍。它当不了一刀切的筛选门槛,但用来排序还是有用的。
而且,不少被记录为"结合失败"的案例,实际上是"表达失败"。结合体的表达量中位数约为2.0mg/mL,而非结合体约为0.5mg/mL。仅凭表达量这一项数据来判断是否结合,AUC也能达到0.60到0.65。蛋白质本身没能正确制造出来的话,结合实验根本无从谈起,但在结果表里,这些情况却被直接记作了"失败"。
两家实验室的判定结果也时常不一致。衡量一致程度的科恩卡帕系数在0.40到0.50之间,两家机构测出的KD值中位数相差约2.2倍。如果连"标准答案"本身都带着噪声,任何预测器都不可能超越这个上限。
编辑视角
这次项目里最该被放大看的数字,不是26.8%,而是3.7%——相差十倍以上。长期以来,蛋白质设计被认为是一件需要大量熟练人才才能做好的事,这个前提在这里被动摇了。
但与此同时,MBP的案例不能被忽略。90个设计,一个结合体都没出来。在TNFα靶点上,一个模型成功而另一个失败,Anthropic如实写明了自己也不清楚原因。
在成绩单里不抹去失败案例的做法,并不常见。正是这两行如实记录,提升了其余数字的可信度。
我们昨天的报道讲的是速度——24小时内完成设计并成功结合。而这次公布的整个项目数据,让画面变得不一样了。比速度更重的事实是:有多个靶点的成绩超过了人类竞赛纪录。
从实操角度看,后续分析反而更有用。它给出了三条建议:先用表达量做初筛;不要只信一个预测器,应该把多个排名综合起来;评估成绩时要按靶点分开看。这三条不需要换用新模型,今天就能直接应用。
尤其是"表达失败会伪装成结合失败"这一点,值得国内生物团队立刻去核实。过去积累的不少AI蛋白质设计成绩单,很可能都没有做这层区分就直接统计了。这意味着,一部分归咎于模型的失败,实际上出在制造环节。
Anthropic自己也划清了边界:要确定命中率和亲和力的最终数值,还需要更全面的性质分析;迷你结合体并非标准治疗形式;高亲和力结合体也只是新药研发的第一步。
不过,这次项目划出的分界线是清楚的:AI蛋白质设计已经过了"能不能造出来"这个阶段。下一步的问题是"该选什么去造",而这些数字共同说明,这个挑选环节目前仍然掌握在人类手里。





评论