
图片:由 METAL AI 生成
摘要
- 谷歌研究在博客中公布了欧洲裔(UKB)与东亚裔(BBJ)队列间基因风险预测迁移学习的结果
- 目标人群样本量较小时迁移学习能提升预测力,但样本量增大后准确度反而下降
- HDL、LDL、血糖三项性状均呈现相同模式,各性状最高准确度在0.101至0.289之间
用欧洲裔数据构建的预测模型,应用到其他人群时会怎样
谷歌研究在其官方博客文章中公布了一项评估提升跨人群基因风险预测准确度方法的研究结果。核心结论与预期略有出入:将用欧洲裔队列数据训练的模型迁移到其他人群的迁移学习方法,在目标人群样本量较小时确实能提升预测力,但随着样本量增大,反而会拉低准确度。
具体来说,多基因风险评分是一种统计模型,它通过整合大量基因变异信息,预测个体患某种疾病或具备某种性状的概率。然而迄今为止大部分大规模基因组研究都以欧洲裔人群为对象,导致这类模型应用到其他种族群体时预测力明显下降。迁移学习正是试图将欧洲裔模型学到的信息,迁移应用到数据较少的其他人群身上的方法。
具体验证了什么
这次评估围绕两个队列展开:包含欧洲裔人群数据的UK Biobank(UKB)和包含东亚裔人群数据的Biobank Japan(BBJ)。目标性状为HDL胆固醇、LDL胆固醇和血糖三项。研究团队将UKB样本量最多扩展到15万人,BBJ样本量则按性状分别扩展到5.6571万人(HDL)、5.8356万人(LDL)、7.4431万人(血糖),观察不同样本量组合下预测准确度的变化情况。
样本量增大后出现的悖论
三项性状记录到的准确度范围如下:
| 性状 | 最小值 | 中位数 | 最大值 |
|---|---|---|---|
| HDL胆固醇 | 0.000 | 0.272 | 0.289 |
| LDL胆固醇 | 0.000 | 0.161 | 0.182 |
| 血糖 | 0.000 | 0.087 | 0.101 |
三项性状都表现出相同趋势:当UKB和BBJ样本量都较小时,准确度接近于零;随着两者样本量同步增长,准确度明显提升。不过谷歌研究特别指出了另一个现象——单独观察BBJ,也就是目标人群的样本量时会发现,在目标人群样本量较小的阶段,来自UKB的迁移学习效果十分显著;但当BBJ样本量超过某个临界点后,加入迁移学习的模型准确度反而开始下降。

为什么会出现这种现象
迁移学习是把在一个领域学到的能力迁移应用到另一个领域的学习方法,常被用来在数据不足时弥补信息缺口。但问题在于,一旦目标人群自身积累了足够的数据,情况就会发生变化。目标人群样本量增大后,模型有了更多素材可以直接学习该人群特有的遗传特征,这时候来自欧洲裔数据的信息反而可能变成干扰因素。基因风险预测模型大多基于以欧洲裔人群为主构建的大规模基因组研究,直接套用到其他人群时预测力下降的问题早已为人所知,而这次的结果进一步表明,即便是试图弥合这一差距的迁移学习方法,其效果也会随样本规模的变化而逆转。
谷歌研究近期还接连推出了将计算方法应用于生物学数据的研究成果,例如此前公布的果蝇雄性大脑16万神经元完整图谱。
编辑视角
这项结果有意思的地方在于,它用数据推翻了"迁移学习总是有益"这一固有认知。此前在基因风险预测领域,种族间的预测力差距问题一直是在"哪怕是欧洲裔数据,有总比没有强"这一前提下被讨论的,而这次结果表明,一旦目标人群数据积累到一定程度,这个前提就不再成立。类似的模式在其他基础模型领域也时有报道:用小规模领域数据对预训练的大模型进行微调时,如果领域数据较少,预训练知识确实有帮助;但一旦领域数据足够充分,预训练知识反而可能拖累性能。基因组数据领域,同样的原理在起作用。
对于国内处理生物样本库数据的研究机构或医院数据团队来说,这个结果值得吸取一个教训:不能在样本量增长后仍然照搬其他人群的模型不放,而应该提前设计好策略切换的时间点——一旦自有数据规模超过某个水平,就要相应降低迁移学习的权重,或转向自建模型。如果不预先按样本规模设定策略调整的分界线,就可能出现即便收集了更多数据、预测力反而下降的悖论。
随着越来越多机构尝试把基因风险预测模型引入实际医疗场景,"该在什么节点切断迁移学习"这一问题,预计将成为下一阶段讨论的焦点。





评论