METAL

OpenAI 的模型设计出一块 96 孔哮喘实验板

OpenAI 把生命科学专用模型 GPT-Rosalind 从研究预览中取出,向 API 和 Codex 开放。在公开演示里,随着一句"生物安全限制已解除"的说明,模型画出了一份实验室可以照原样贴到台面上的计划表。

OpenAI 的模型设计出一块 96 孔哮喘实验板

图片:@OpenAIDevs (X)(视频截图)

摘要

  • OpenAI 于 9 月 11 日把生命科学模型 GPT-Rosalind 从研究预览中取出,向符合资格的机构在全球开放。
  • 在公开演示中,模型为三个哮喘靶点排了序,还画出了 96 孔扰动实验的板位图。
  • 谁能用由公司审核决定,而 API 只允许用于经批准的内部研究。
Bring stronger biological reasoning to your research with GPT-Rosalind in the API and Codex.

9 月 11 日,OpenAI 开发者账号上传了一段 56 秒的屏幕录制。窗口标题是 Compare IL33 vs TSLP vs IL1RL1,旁边标着 asthma program。这是在三个哮喘新药靶点之间挑出先推哪一个的工作。屏幕右下角挂着模型名称 GPT-Rosalind 和调到 Extra High 的推理强度。

METAL 逐帧看过那段视频,模型工作了 9 分 25 秒之后给出了排序。它从 Life Science: Research 插件取来六条彼此独立的公开证据脉络,与一份本地的内部资料包对照之后,整理出的总排序是 TSLP 在 IL33 之前、IL33 在 IL1RL1 之前。理由也附上了,连证据的行号都标了出来。TSLP 居前,是因为它是这里唯一有哮喘获批记录的通路;IL33 的人类遗传学信号最强,但临床先例还停在 2 期水平,因此被往后压。模型自己写道,六条脉络之间唯一真正有分歧的地方是 IL33 和 IL1RL1 的先后。

到这里都还是读文献、做整理的活。视频的重量在接下来那道指令。屏幕前的人让它设计一个实验,用来检验 TSLP 是否值得继续排在 IL33 之前。把人的气道上皮与免疫细胞共培养的 96 孔扰动实验、多个时间点、抗 TSLP 作为一级轴、抗 IL33 作为二级轴、并包含对照组,条件全是用话说出来的。模型新写了一个 Python 文件,又做出两个,画出了一张像座位表一样的 96 孔板位图。

那张板位图上写的数值,说明了这次发布是什么性质。96 孔,6 小时、24 小时、48 小时三个时间点,八种条件,每个条件与时间点各四次技术重复,每位供体一块板。刺激物和两类对照也都指定了,一级评价指标是与受刺激对照相比、24 小时到 48 小时之间的 IL-13 抑制量。这是一份实验室可以照原样贴上台面的计划表,而视频里的说明把这件事称作不止步于产生假设、而是真正搭起实验台的反馈回路。

而那段说明里还挂着这次发布中最重要的一个条件从句。旁白说,"在生物安全限制已解除的状态下,Life Sciences 模型能够提出新的假设、设计实验,并优化现有的新药研究流程"。限制解除,并不意味着对任何人都解除。它意味着对谁解除,由公司审核来定。

据 OpenAI 的发布文,GPT-Rosalind 于 9 月 11 日走出研究预览,通过信任访问计划向符合资格的机构在全球开放。公开价格自 10 月 5 日起适用,通过资格审核的客户可以在 ChatGPT、Codex 和 API 中使用这个模型。它最初于 4 月 16 日亮相,名字取自留下了揭示 DNA 结构的关键资料的 Rosalind Franklin。公司把一项事实摆在了发布文的前面:在美国,一款新药从靶点发掘走到监管批准,通常需要 10 到 15 年。

成绩单也一并公开。按产品页面,每单位 token 的性能在 Genebench 上提升 53.7%,Labworkbench 上 19.6%,Medchem Bench 上 18.0%,LifeSci Bench 上 4.4%。在处理真实生物信息学分析的 BixBench 上,它在已公开分数的模型中领先;在衡量文献检索、数据库访问、序列操作与流程设计的 LABBench2 上,公司表示它在十一项任务中的六项上胜过 GPT-5.4。提升最大的一项,是从头到尾设计分子克隆所需 DNA 与酶试剂的任务。

也有与人正面较量的结果。OpenAI 与打造 AI 设计基因疗法的 Dyno Therapeutics 合作,用未公开、不可能混入训练的序列,测试了把 RNA 序列与功能对接起来的任务。与该领域专家过去留下的 57 个分数相比,在 Codex 应用中提交的十份答案里最好的那一份,在预测任务上进入前 5% 以内,在序列生成任务上落在前 16% 附近。进入前 5%,意味着做得和这个领域二十位专家里的一位一样好。

用社会制度的眼光看这份清单,变的不是性能而是门槛。OpenAI 写道,参与机构必须在从事有明确公共利益的正当科学研究,必须具备防止滥用的治理与合规机制,并且必须把访问限制在安全受控环境中经批准的用户范围内。信任访问先从美国具备资格的企业客户开始。按帮助文档,API 只允许用于经批准的内部研究,不能用在面向客户的产品或外部商业应用上。能力向全球开放了,但使用这份能力的资格,由公司的审核表来定。

看名单就能猜到哪些地方通过了这张审核表。安进、Moderna、诺和诺德、赛默飞世尔科技、Oracle Health and Life Sciences、NVIDIA、艾伦研究所、Benchling、加州大学旧金山分校药学院都在合作名单里。协助落地的顾问方则有麦肯锡、波士顿咨询公司和贝恩。安进人工智能与数据部门高级副总裁 Sean Bruich 表示,"生命科学领域在每一个环节都要求精确。问题高度复杂,数据高度独特,而风险代价极高"。公司还表示,正在与洛斯阿拉莫斯国家实验室一同探索用 AI 设计蛋白质与催化剂。

同一道门槛也朝相反方向起作用。OpenAI 另设了 Rosalind 生物防御计划,面向构建早期监测、预备、诊断、响应与医疗应对手段的开发者与公共卫生组织。这是一种在抬高生物学能力的同时、先把这份能力分配给防御一侧的设计。资格审核既是锁住能力之门的装置,同时也是分配优先权的装置,这一点在这里变得清楚。谁能取得设计实验的资格,如今不是技术问题而是审核问题。

也有免费开放的部分。Codex 用的 Life Sciences 研究插件已在 GitHub 上公开,是一套接通 50 多个公开多组学数据库、文献来源与生物学工具的技能包。通过资格审核的企业用户把这个插件与 GPT-Rosalind 一起用,其他用户也可以把它与 OpenAI 的主线模型一起用。门槛之上的模型给通过审核的地方,门槛之下的管路则对所有人开放。

剩下的问题是计划表与结果之间的距离。METAL 曾整理过AI 设计的蛋白质在预测与实际结果上出现分歧的报告,而 96 孔板位图画得再精细,把那块板填满、再等 48 小时,依然要靠人的手和人的时间。OpenAI 这次卖出的不是答案,而是一份用来检验答案的计划表,而这份计划表的价值只在实验台上被打分。

所以这次发布真正的内容不是模型性能。而是在生物学领域里,决定 AI 可以做什么的权力,比监管机构更早地坐上了模型公司的审核表。能力已经向全球开放,剩下的门只有那张审核表。

评论