
图片:由 METAL LAB 生成
摘要
- AI2的AutoDiscovery在浸润性小叶癌中发现了比预期更强的免疫信号。
- 在通过独立数据集复现和肿瘤组织免疫荧光成像完成两轮验证后,双方于8月27日宣布扩大合作。
- 这一亚型约占美国乳腺癌确诊病例的15%,此前一直被排除在免疫治疗候选人群之外的患者群体,如今重新被纳入了考量。
曾被认为免疫治疗无效的癌症出现了信号
AI2与Providence Swedish癌症研究所8月27日宣布扩大合作。促成这一决定的是两家机构联合运行的AI工具AutoDiscovery——它在浸润性小叶癌中发现了比预期更强的免疫信号。同一天,相关论文也一并公开。
长期以来,浸润性小叶癌一直被归为"免疫冷"肿瘤——医学界认为免疫细胞很难进入肿瘤内部,因此免疫治疗对其无效。但这次AI从数据中挑出了一个与这一分类相悖的信号。
看数字就知道分量有多重。这一类型约占美国每年新确诊乳腺癌病例的15%。这意味着,此前实际上被排除在免疫治疗候选之外的患者群体,如今有可能重新被纳入考虑范围。
浸润性小叶癌在乳腺癌里也算是比较棘手的一类。它的癌细胞不会聚成团块,而是呈单行排列、分散浸润,因此在影像上不容易被捕捉到,组织内部与免疫细胞相遇的方式也和其他类型不同。这正是它长期被排除在免疫治疗讨论之外的原因。

验证做了两轮
这次发布中真正值得关注的不是发现本身,而是验证过程。研究团队先在另一个独立的乳腺癌数据集中确认同样的信号是否会再次出现,随后又用免疫荧光成像技术观察了肿瘤样本。结果不仅看到了激素受体标记,还实际看到了包围肿瘤的T细胞。
免疫荧光成像是给特定蛋白质贴上荧光标记,从而在组织中直接用肉眼看到相应细胞位置的技术。它相当于最后一道关卡,用来确认统计上捕捉到的信号是否真的出现在组织的同一位置。
先提出假设,再用另一组数据复现,最后用肉眼确认——三个环节都补齐之后,双方才宣布扩大合作。
论文中同时列出了双方研究者的名字。Providence方面由Paulson博士参与,Earle A. Chiles研究所方面则由Sasha Stanton博士参与。
AI2表示,一项发现要真正影响后续研究,就必须做到透明、可复现,并经过独立验证。这也是此次发布材料花更多篇幅讲解流程、而不是发现本身的原因。
只留下"意外"又"反复出现"的信号
AutoDiscovery是一款利用大语言模型生成假设并自我评估的工具。它筛选信号的标准有两个:相对于既有预期是否足够意外,以及在多次分析中是否反复出现。
关键在于同时满足这两个条件。只是意外,很可能只是噪音;只是反复出现,说明这早已是人所共知的事实。只有两者兼具,才能筛选出真正值得研究者深入研究的候选信号。
这次分析的对象是癌症基因组图谱(TCGA),这是迄今为止规模最全面的癌症数据集之一。
打个仓库整理的比方就好理解了:东西全都进了库房,可没人知道具体放在哪儿。
Providence Swedish癌症研究所免疫肿瘤中心主任Kelly Paulson博士的话正好点出了这一点:"癌症研究者现在能接触到的数据集本身已经非常惊人。问题不再是收集数据,而是如何理解这些数据集想要告诉我们的一切。"

工具主动走向数据所在之处
此次扩大后的合作分为四个方面:Providence的研究者与AI2的科学家共同撰写论文;AutoDiscovery被部署在Providence自有的云环境中;在该环境内可以访问受保护的科研与临床数据;部署和运维则由癌症研究所的计算研究团队负责。
这里关键在于部署的位置。不是把数据搬出来,而是让工具进入数据所在的地方。在和处理患者数据的机构合作时,如果不是这个方向,合作协商根本无从谈起。
AI2高级研究员Bodhisattwa Majumder这样总结这款工具的定位:"AutoDiscovery不是为了取代科学专业知识而设计的,而是为了放大它。"
设计初衷也是这个方向。AutoDiscovery并不是要取代研究者的位置,而是作为在旁协同运作的辅助工具而设计。它负责缩小候选范围,至于深入研究哪一个,仍由人来决定。
AI2是一家非营利研究机构,目前由临时负责人Peter Clark主持运营。它一直以公开模型和数据的方式,与商业实验室保持着不同的定位。
编辑视角
这次发布中最有价值的地方不是发现本身,而是验证流程。过去一年里,"AI提出假设"这类消息已经出现了几十次,但其中真正在独立数据集中完成复现、再用组织样本影像亲眼确认之后才对外发布的案例,屈指可数。
"免疫冷"肿瘤这一分类,长期以来一直写在教科书里。要让人主动去怀疑与这一分类相悖的信号,其实很难——毕竟重新质疑早已被公认的结论,很难拿到研究经费,也很难获得时间投入。AI在这里做的,与其说是给出了答案,不如说是打开了一个长期没人再去翻看的抽屉。
AI2昨天发布的《AI辅助科研的五大障碍》文档,恰好与这次案例严丝合缝地对上了。当时梳理出的问题意识,这一次以实际流程的方式呈现了出来——同时押注意外性与可复现性,做两轮验证,最后交由人来把关。
韩国国内的医院和研究机构真正该借鉴的,不是这个模型本身,而是这种部署方式。韩国的医疗数据很难被带到机构外部,因此AI导入方面的讨论大多止步于数据外流的协商阶段。
Providence把这个顺序倒了过来。他们把工具引入自己的云环境,安装和运维都由自己的计算团队负责,数据一步都没有挪动。
还要指出15%这个数字的性质。它代表的不是治疗效果,而是需要重新评估的人群规模。免疫治疗对这一患者群体究竟是否有效,还得靠临床试验来回答,而这个答案可能要等上好几年才会揭晓。即便如此,原本没有候选人群的地方出现了候选人群,这本身就是临床试验设计的起点。
"AI正在改变科学"这句话,如今已经不新鲜了。这次案例的不同之处在于,被改变的对象不是论文摘要或代码,而是患者分类本身。在重新划定哪些患者该被视为哪种治疗候选人的这条界线上,AI已经参与了进来。





评论