
이미지: Google 화면 갈무리
摘要
- 谷歌研究院发布了GlucoFM,这是一款仅使用连续血糖监测(CGM)原始数据进行自监督训练的基础模型。
- 在14项队列-任务评测中,该模型的平均PR-AUC从54.7提升到58.8,比此前最强模型高出4.1分。
- 即便在标签极度稀缺的情况下,它依然表现领先,这对临床标签难以获取的代谢疾病研究来说是个利好。
- 모델명·발표
- GlucoFM · 구글 리서치 · 2026-08-26
- 구조
- 느린 기저 변화와 단기 요동을 분리하는 이중 스트림 자기지도학습 모델
- 사전학습 데이터
- Wear-CGM 등 5개 데이터셋, 109,066시간, 477명 참가자·세션
- 평가 규모
- 4개 코호트(CGMacros·Stanford·Hall·ShanghaiT2DM), 7개 임상 과제, 14개 조합
- 평균 PR-AUC
- 54.7 → 58.8 (기존 최강 베이스라인 대비 +4.1점, 약 7.5% 상승)
- 식후 혈당 예측 MAE
- 21.88 mg/dL (최고 베이스라인 22.90 mg/dL, 874건 식사 이벤트·34명)
- 교차 데이터셋 전이
- 12개 평가 중 11개서 기존 최강 모델보다 0.5~8.6점 우위
谷歌研究院于8月26日发布了基础模型GlucoFM,该模型仅依靠连续血糖监测仪(CGM)数据就能预测糖尿病风险和胰岛素抵抗。即便没有带标签的临床数据、只学习了原始血糖信号,在14项队列-任务评测中,代表精确率-召回率曲线下面积的PR-AUC平均值仍从54.7提升到58.8,比此前最强的模型高出4.1分。
CGM数据为何难以解读
智能手表之类的可穿戴设备是通过运动和心率等间接信号来推测活动量和睡眠状况的,并不能直接反映血糖调节情况。相比之下,CGM通过植入皮下的微型传感器每隔几分钟测量一次组织间液葡萄糖浓度,能够捕捉到空腹、夜间、餐后等各种血糖模式。问题在于,用来解读这些信号的高质量临床标签本就稀缺,获取成本也很高。此前的CGM基础模型如CGMformer、GluFormer、CGM-JEPA都只把血糖信号当作单一的表征流来处理,没能把缓慢的基础模式与进食、活动、传感器噪声引起的短期波动区分开来。
把缓慢走势和短期波动分开学习
GlucoFM正是针对这一点设计的:它先将24小时的血糖记录对齐到5分钟间隔的网格上,再单独维护一个掩码来区分有观测值的点和空缺的点。编码器分为两路,一路负责缓慢变化的血糖基础走势,另一路负责由进食、活动、传感器噪声引起的残差波动。该模型并不直接复原原始血糖数值,而是采用预测潜在表征的两个目标进行预训练,并在训练过程中人为引入基线偏移、压缩损失、稀疏采样、短时断连等真实CGM记录中常见的数据缺失情况。整个模型的预训练数据由两组Wear-CGM数据和四个现有公开数据集合并而成,总计109,066小时、477名参与者/会话的无标签数据。
领先程度如何
谷歌研究院在CGMacros、Stanford、Hall、ShanghaiT2DM四个队列上评测了七项临床任务:糖尿病风险、胰岛素抵抗、β细胞功能障碍、高血脉症、低血糖、肥胖以及血糖类型划分。评测方式是固定编码器、只重新训练一个线性分类器,并且确保训练集和评测集中不出现同一参与者重叠的情况。
| 对比项 | 此前最强模型 | GlucoFM |
|---|---|---|
| 平均PR-AUC(14项组合) | 54.7 | 58.8 |
| 相对GluFormer(同语料预训练) | 基准 | +5.8分 |
| 餐后2小时血糖预测MAE | 22.90 mg/dL | 21.88 mg/dL |
| 跨数据集迁移(12项评测) | 基准 | 11项领先0.5~8.6分 |
GlucoFM在全部糖尿病风险和β细胞功能障碍评测中都拿到最高分,在四项胰岛素抵抗评测中也有三项排名第一。在使用Dexcom和Libre两种CGM设备、来自34名参与者的874次进食事件数据上预测餐后血糖变化时,在综合了餐前一小时数据、营养信息、空腹血糖和体重指数的条件下,该模型的平均绝对误差为21.88 mg/dL,优于此前最佳基线的22.90 mg/dL,也优于简单平均基线的27.69 mg/dL。
标签越少,差距越明显
将单日记录最多按7天做平均汇总后,大多数设置下的预测力都有所提升——Stanford的β细胞功能障碍评测提升了9.6分,Hall的糖尿病预测提升了14.0分。在把某一队列上训练出的分类器直接应用到完全不同队列的跨数据集迁移测试中,GlucoFM在12项评测中的11项以0.5~8.6分的差距领先此前最强模型,绝对PR-AUC值从61.6%(Stanford→Hall)到90.0%(Hall→CGMacros胰岛素抵抗)不等。即便在每类只有一名标注参与者、观测值仅取1%这种极端稀缺标签的条件下,GlucoFM的表征依然保持最高分——这一点对临床标签难以获取的实际研究环境来说尤其有价值。研究团队还将这种双流结构与原始输入版本、只用基础走势版本、只用短期波动版本进行了对比,结果显示只用波动信息的版本表现最弱,而同时使用两路信息的完整模型始终领先。
此前谷歌研究院为医疗AI'AMIE'加入影像与语音问诊能力的案例也属于同一团队在医疗健康AI方向上的延续性研究——如果说AMIE处理的是问诊这一交互环节,那么GlucoFM则站在更前一步的生理信号解读位置。
研究团队在论文中提到,目前的局限在于预训练所用人群规模还不算大。他们表示接下来会扩展到更大、更多元的人群,同时计划超越目前以24小时为单位的独立处理方式,发展能跨越数周、数月的多日建模,并加入实时响应能力,作为下一阶段的目标。
编辑视角
CGM市场最初是从服务糖尿病患者的医疗器械起步的,近几年逐渐向普通消费者的代谢健康管理设备扩展。这个赛道一直卡在同一个瓶颈上——传感器每5分钟就吐出一批数据,但能把这些数据翻译成"此人糖尿病风险偏高"这类判断的带标签临床病例,哪怕一家医院也很难攒够几百例。GlucoFM瞄准的正是这个缺口。先用无标签的原始信号学习表征,再在此基础上叠加极少量标签来提升性能,这种思路在医疗AI领域已经反复出现过好几年,但在个体差异极大、且不同设备(Dexcom、Libre)测出的数值本身就有偏差的血糖信号领域取得这种迁移效果,还是值得关注的结果。
把同等规模的自监督基础模型放到真实队列数据上测试时,往往会出现同一种模式——如果把数据揉成单一表征流塞进去,初期表现看起来还不错,可一旦换到别的队列,分数就会崩掉。GlucoFM把基础走势和短期波动结构性地分开处理,却在跨队列迁移测试的12项中赢了11项,这说明这种分离并非单纯的设计偏好,而是确实在过滤噪声上起到了作用。
国内值得关注这项技术的,应该是经营CGM设备的医疗器械企业、数字健康初创公司,以及长期积累队列数据的医院研究团队。如果想在降低标注成本的同时确保预测力,与其从零开始给自有数据全面打标签,不如先考虑借用这类预训练表征、再叠加少量标签的做法。不过这次评测只覆盖了四个规模在几百人级别的队列,反映韩国人代谢特征的队列能否取得同等迁移效果,仍是另一个待验证的问题。
未来几个月里,这篇论文能否在其他研究团队的CGM队列上得到复现、性能差距能否维持,将是值得关注的看点。既然谷歌研究院已经把多日建模和实时响应明确列为下一阶段目标,这套表征方法很可能会流向同时使用可穿戴设备和CGM的消费级代谢健康服务。




评论