
图片:METAL
摘要
- Google DeepMind 于 9 月 30 日发布 SynthID Bio,可在 AI 设计蛋白质的序列和预测结构中嵌入不可察觉的水印。
- 在 VEGF-A、SARS-CoV-2 刺突蛋白受体结合域和 PD-L1 三个靶点的实验中,带水印设计的命中率、结合亲和力和序列多样性与无水印设计相同。
- DeepMind 将这项技术定位为用于 DNA 合成筛查和公共数据库管理的来源信号,并公开方法论文、代码和权重。
Google DeepMind 于 9 月 30 日发布了 SynthID Bio,这是一项为 AI 设计的蛋白质嵌入水印的技术。它不是在数字文件上做标记,而是把不可察觉的签名直接写入生物代码本身,而且这一签名在实际合成出的物理蛋白质上也能被验证。公司表示,在实验室测试中水印没有损害蛋白质的生物学功能。这是此前用于图像和文字的 SynthID 首次被引入合成生物学。
出发点是生物安全的漏洞。据 DeepMind 介绍,从预测蛋白质结构的 AlphaFold,到设计新蛋白质的 AlphaProteo 和 ProteinMPNN,再到最近设计感染细菌的病毒即噬菌体,生成式 AI 正在解决各类生物学问题。然而 AI 生成的新设计可能绕过传统的 DNA 合成筛查,而标注错误的合成 3D 结构可能污染公共数据库、误导后续研究。水印正是针对这两点。
其工作方式因数据类型而异。对蛋白质序列,它会微妙地引导氨基酸的选择;对预测的 3D 结构,则调整原子坐标,从而生成可检测的信号。验证对象是蛋白质结合体,即为选择性结合其他蛋白质而构建的分子。研究人员将公司自有的结合体设计方法 AlphaProteo 与启用 SynthID Bio 的 ProteinMPNN 结合使用来生成设计。
结果来自三种靶蛋白。在针对血管生成因子 VEGF-A、SARS-CoV-2 刺突蛋白受体结合域以及免疫检查点蛋白 PD-L1 的湿实验中,带水印的设计在命中率、结合亲和力和天然序列多样性上与无水印设计相同。DeepMind 表示,这由此产生了首批既带水印又具有生物学功能的蛋白质结合体。Adaptyv Bio 参与了实验验证。
在结构预测方面,方法更为大胆。SynthID Bio 对 AlphaFold 3 扩散网络的一小部分进行微调,把水印能力直接写入模型权重。因此,无论谁运行模型,预测出的 3D 坐标中都会留下可检测的签名。据公司介绍,该方法在保持 AlphaFold 3 预测准确度的同时实现了近乎完美的可检测性,保留了关键结构特征的分布,并能抵御数字噪声和微小的坐标改动。

这项技术最先会用到的地方是 DNA 合成筛查。要把数字蛋白质设计变成实际分子,必须向 DNA 合成供应商下单,而供应商会把订单与已知威胁数据库进行比对。过去,陌生序列可以被放心地假定为尚未发现的天然生物,但 AI 会创造出与已知危险几乎毫无相似之处的新序列。DeepMind 解释说,与其因人工逐一审查陌生订单而拖慢研究,水印可以成为一种自动信号,证明订单来自内置安全措施的可信模型。
合成行业的反应也集中在这一点上。曾对论文提供早期反馈的 Twist Bioscience 政策与生物安全副总裁 James Diggans 表示:"AI 正在扩展科学家能够设计的范围,而 DNA 合成公司在帮助这种创新负责任地扩大规模方面扮演着重要角色。"他补充说,水印可能成为加强筛查、把资源集中到需要更仔细审查的序列上的新工具。审阅了这项研究的生物安全政策专家、Science Policy Consulting 负责人 Sarah Carter 评价说:"SynthID Bio 是追踪生物设计来源这一拼图中的重要一块",并指出通过把设计与模型开发者联系起来,可以让开发者主导安全工作。
从法律责任的角度看,这种水印是一种来源证明装置。一旦设计出自哪个模型被记录在分子中,合成供应商就有了核查订单来历的依据,模型开发者也能自行设计其模型产出的问责路径。生物安全非营利组织 NTI 在评论中描述了供应商用密钥确认水印存在且与客户提交信息一致的机制,并指出仅靠水印无法阻止蓄意滥用。NTI 认为,这项技术可以成为与 IBBIS 的 Common Mechanism、NTI | bio 与 Lattice Automation 正在制定的生物设计元数据安全标准,以及 Sentinel Bio 的客户审查模式 BioTrust 相互衔接的一层。DeepMind 自己也把 SynthID Bio 定位为瑞士奶酪模型中的一层,即多重独立安全措施彼此弥补盲区。
数据库管理也是用途之一。在蛋白质数据库、UniProt 和 GenBank 等接受公开提交的资料库中,标注错误的条目可能严重干扰生物安全判断,而随着 AI 生成的生物数据不断增加,这种风险也在上升。DeepMind 表示,在提交过程中 SynthID Bio 可以确保合成条目被正确标注,或被标记以供进一步审查。公司把增强对蓄意篡改的抵抗力列为今后的挑战,并提出将水印与类似数字媒体 C2PA 的来源元数据,或 AI 生成生物数据的中央资料库相结合的方案。
应用范围正从蛋白质延伸到基因组。DeepMind 与斯坦福大学和 Arc Institute 的 Hie 实验室合作,把 SynthID Bio 集成进基因组模型 Evo 2,为 Evo 2 设计的噬菌体基因组嵌入了水印。在细菌培养的早期测试中,这些带水印的噬菌体功能正常,公司表示将很快发布技术论文。METAL 此前报道过 Claude 自主设计蛋白质并成功结合的案例,设计速度越快,为其产物贴上标签的分量就越重。
发布方式同样值得关注。根据 METAL 核实的 DeepMind 公告,公司将发表方法论文,开源代码和体外数据,并向研究界公开权重。该项目由 Pushmeet Kohli 发起,研究由 Alexander Cowen-Rivers 和 David Stutz 领导。水印要成为来源证明的标准,就必须是合成供应商、数据库和其他模型开发者都能读取的信号,而不是一家公司的工具,公开代码和权重正是满足这一条件的第一步。





评论