
图片:METAL
摘要
- 微软以 MIT 许可证开源了逆合成模型 RetroChimera,论文发表于《自然》。
- 该模型把基于 Transformer 的 R-SMILES 2 与基于图神经网络的 NeuralLoc 的预测用学习到的投票合并。
- 在博士级化学家的盲评中,10 个高难度靶标里有 9 个的完整路线获得通过。
微软公开了把目标分子反向拆解、据此规划合成路线的 AI 模型 RetroChimera,并把权重与实现以 MIT 许可证开源。承载同一研究的论文发表在《自然》上。在博士级有机化学家不知道哪一方产出哪个提案的盲评中,该模型的建议不仅胜过既有模型,也胜过文献中已记录的反应。
逆合成是从想要制造的分子出发,一步步拆成更简单的前体,一路回溯直到触及可以买到的原料。研究者把这件事比作国际象棋或围棋这类策略博弈,同时点出了决定性的差别:可走的步数远多于棋类,而且对于给定分子究竟有哪些步可走,本身就不是显而易见的。因此长期以来,这种组合爆炸被视为无法自动化的领域。
RetroChimera 没有去把单个模型做大,而是把两个取向不同的模型接在一起。R-SMILES 2 是基于 Transformer 的生成模型,使用把分子写成字符串的表示法,直接从输入分子生成前体。它有从数据中直接学习反应模式的灵活性,但不受约束地生成,也意味着凭空编造的余地同样变大。NeuralLoc 基于图神经网络,把目标分子与反应模板都编码为图,预测选用哪个模板以及把它作用在分子的哪个位置。由于被绑定在训练数据抽取出的反应模式上,它更准确也更稳定,但面对模板库里没有的反应时回旋余地较小。
这个差别不是弱点,而是设计的轴心。两个模型擅长的反应类型不同。R-SMILES 2 特别适合反应过程中分子结构变化较大的情形,NeuralLoc 则在先例稀少的反应与发生局部变化的反应上领先。RetroChimera 用学习到的集成策略合并两者排过序的预测。每个模型对预测出的反应物集合投出一张随排名变化的、学习得到的票,当两个模型提出同一个反应时,票数相加。这是一种由学习来决定在哪个排名上该多信任哪个模型的结构。
论文还写到,同一套投票框架可以再接入其他提案来源。把反应数据库查询或有人介入的问询作为额外输入接上,模型预测、机构内部数据与专家判断就能在同一处汇合。
数字分成两条线。在公开基准上,RetroChimera 在 USPTO-50K 与 USPTO-FULL 两边都刷新了最佳成绩,把 top-10 准确率分别提高了 1.7 个百分点与 1.6 个百分点。更醒目的是人给出的评分。面对 10 个高难度靶标,在每一步都必须通过专家审查才算数的标准下,RetroChimera 在其中 9 个上拿到了完整路线。同样条件下,de novo 模型为 5 个,编辑模型为 4 个,基线 NeuralSym 为 2 个。来自微软与主要制药公司的 9 位博士级有机化学家,在该模型的最优建议与制造同一分子的既有文献方式之间做选择时,约 64% 的比例选了模型这一边。
在产业现场卡住的问题是数据不同。制药公司手里的自有化学数据与公开数据集性质有别。研究者展示了预训练的 RetroChimera 可以不太费力地适配到 GSK 的内部数据,《自然》论文摘要写明在两家主要制药公司的内部数据集上同时确认了零样本迁移与微调。不做额外训练直接迁到新数据集,性能也优于两个子模型。共同作者名单中,诺华生物医学研究院的五位研究者与微软研究院 AI for Science 团队并列在内。
METAL 从 arXiv 直接下载了预印本原文(arXiv:2412.05269)文件并自行清点 PDF 页数,正文、参考文献与扩展数据合计为 28 页。标注为同等核心贡献者的第一作者是 Krzysztof Maziarz 与刘国庆。作者中还包括剑桥大学与雅盖隆大学的成员。主检查点使用比公开数据集整理得更好的 Pistachio 训练,该数据的样本量是 USPTO-FULL 的 3.5 倍。
公司为使用者附上的限定条件很具体。仓库文档写明该检查点使用截至 2023 年的反应数据训练,因此不包含此后的化学。Pistachio 本身存在噪声,预测需对照相关文献加以确认,面对与训练分布差异较大的化学,性能可能下降。由于排名越靠后的反应越可能是编造出来的,"每个输入不要索取超过五到十个反应"的建议,与"配合反应可行性模型并开启共识模式"的建议写在同一处。研究者在仓库中明确写道:"在真实环境中使用任何预测之前,必须由化学专家独立进行风险评估与验证。"
公开的方式本身也是讯息。模型以 MIT 许可证上传至 GitHub,也可通过 Microsoft Foundry 访问。包括资深首席研究经理 Marwin Segler 在内的作者们在博客中写道:"我们希望你用一切可能的方式去把它弄坏,并把结果分享回来。"他们把索要失败案例的请求,放在了展示性能的同一个位置上。
METAL 曾报道过 AI 设计的蛋白质中预测与实际结果出现分歧。那道缝隙也是阅读这次发布的位置。此次评估汇集的是专家判断,并不是在实验室里真的合成出来的结果。提出的路线仍需经过可行性审查与实验验证,10 个靶标这一样本也说明不了整个化学空间的性能。公开反应数据偏向成功且记录良好的实验,这一点同样依旧存在。
即便如此,这篇论文挪动了什么是清楚的。化学家看到模型输出会不会点头,长期以来是评分表上没有的项目,与准确率数字各走各的。RetroChimera 把这个项目放到了与基准同等的重量上,并报告说在与文献所记录的人类选择正面比较中胜出。从工程视角更值得留意的是,做到这一点靠的不是单个模型的规模,而是两个取向不同的模型之间的投票。与其把一个做得更大,不如让它们互相填补空白——在当前这个领域里,这才是走得更远的那条路。
信息来源
- Microsoft Research — Improving synthesis prediction of small molecules at scale with RetroChimera →
- Nature — Chemist-aligned retrosynthesis by ensembling diverse inductive bias models →
- Microsoft Source — RetroChimera: New research advances AI-assisted molecule synthesis →
- Microsoft — microsoft/retrochimera — GitHub 저장소 →
- Microsoft Research — Microsoft Research 공식 X 게시물 — RetroChimera →





评论