
이미지: Google 화면 갈무리
摘要
- 谷歌研究院公开了多智能体系统"BDF",用于从可穿戴设备生理信号中寻找生物标志物候选
- 该系统分析了3个队列、共9279份参与者-观测数据,得出精神健康领域41个、代谢疾病领域25个候选指标
- 在15名专家的盲评中,该系统在所有质量指标上均超过了现有的3种AI研究系统
- 명칭
- Biomarker Discovery Framework(BDF)
- 개발
- 구글 리서치, MIT 박사과정 김유빈이 구글 인턴십 중 주도
- 검증 규모
- 3개 코호트, 참가자-관측 9,279건(DWB·GLOBEM·WEAR-ME)
- 발견 후보 수
- 정신건강 41개, 대사질환 25개 디지털 바이오마커
- 대표 상관관계
- DWB 코호트, 수면시간 변동성-PHQ8 우울증 중증도 ρ=0.252(p<0.001)
- 예측력 개선
- 인구통계 변수 결합 시 ΔR²=0.040(우울증), 0.021(인슐린저항성)
- 검증 절차
- 후보는 11개 항목 적대적 필터링 통과 필요
- 전문가 평가
- 15명 블라인드 평가, 7개 품질 지표 전부 최고점, 원고 유지율 56.9%
睡眠一旦紊乱,身体先知道
如果智能手表每天测量的睡眠时长夜夜起伏不定,这种波动幅度本身可能就是抑郁症风险的信号。谷歌研究院8月21日通过官方博客介绍了一种以这种方式从可穿戴设备收集的生理信号中寻找具有临床意义的指标(生物标志物)候选的多智能体系统——"生物标志物发现框架"(Biomarker Discovery Framework, BDF)。该系统的核心在于将反复的假设生成、统计分析与基于文献的推理结合起来。
数据在堆积,假设却不足
谷歌研究院指出,可穿戴设备如今已能在人群规模上持续收集心率变化、睡眠模式等生理信号。研究团队表示,瓶颈已不再是数据收集本身,而是如何将这些信号转化为可信的临床假设。研究团队指出,现有基于语言模型的智能体系统往往只针对预测性能进行优化,未能过滤掉偶然相关性、数据泄漏和不稳定特征。
六个阶段,四个子智能体
BDF的结构是:编排智能体(Orchestrator)将自然语言的研究指令拆解为执行计划,而名为Scout、Critic、Defender、Mechanism的专业子智能体在共享状态之上执行六个阶段的流程。该设计的核心在于将确定性统计计算与生成式推理分开处理——假设的提出由生成式推理负责,而验证假设是否具有统计有效性则由确定性计算完成。候选指标须严格分离特征构成与目标信号,并通过一个由11项组成的对抗性过滤阶段,才能最终成为候选指标。
举例来说,如果收到寻找与抑郁症严重程度相关的可穿戴设备候选指标的请求,BDF会对DWB数据集进行画像分析,提出诸如睡眠开始时间波动性之类的特征,并估算睡眠时长波动性与PHQ-8抑郁症严重程度量表之间的关联。随后依次检验稳定性、数据泄漏、亚群体一致性、替代解释可能性,最终才整理成可供人工审阅的假设。
从9279份参与者-观测数据中筛选出41个和25个候选指标
研究团队将两个精神健康队列——DWB和GLOBEM——以及涉及代谢疾病的WEAR-ME队列合并,对共计9279份参与者-观测数据应用了BDF。在此过程中,系统自主发现了精神健康领域41个、代谢疾病领域25个候选数字生物标志物。
| 队列 | 领域 | 发现指标 | 关联数值 |
|---|---|---|---|
| DWB | 精神健康 | 睡眠时长波动性 | ρ=0.252, PHQ-8, p<0.001 |
| GLOBEM | 精神健康 | 睡眠开始时间波动性 | ρ=0.126, PHQ-4, CV AUC=0.535 |
| WEAR-ME | 代谢疾病 | 心血管体能指数(步数/静息心率) | 与胰岛素抵抗相关 |
研究团队强调,由于两个精神健康队列的样本和测量指标各不相同,并非同一候选指标得到了重复验证,这应被解读为概念层面的趋同,而非直接的重复验证。在代谢疾病领域,研究团队新构建了将步数除以静息心率得到的心血管体能指数,并将其与胰岛素抵抗相关联。将这些指标与人口统计学变量结合后,预测性能分别提升了ΔR²=0.040(抑郁症)和ΔR²=0.021(胰岛素抵抗)。
15名专家打出的评分
研究团队让来自医学、生物医学数据科学、机器学习、生物信息学、数字健康领域的15名专家,对BDF与谷歌DeepMind的AI co-scientist、Biomni,以及谷歌ADK的数据科学智能体等三个同类AI研究系统撰写的报告进行了盲评。
| 评估项目 | BDF | 对比系统3种 |
|---|---|---|
| 原稿内容保留率 | 56.9% | 18.8%~30.4% |
| 四方比较中排名第一次数(共13次) | 9次 | - |
| 模拟审稿中获Accept/Minor Revision建议 | 唯一 | 无 |
在盲评中,BDF在全部七项质量指标上均获得最高平均分。在采用模拟学术期刊审稿标准时,唯有BDF获得了Accept或Minor Revision的建议。具体分布为:Accept 2件、Minor Revision 8件、Major Revision 8件、Reject 3件。该项工作由麻省理工学院博士生Kim Yubin在谷歌实习期间主导完成,由Hamid Palangi和Daniel McDuff指导。
编辑视角
这项发布值得关注的地方不是模型性能,而是验证结构。近来的AI研究自动化系统大多沿着提升语言模型推理能力的方向展开竞争,而BDF反其道而行之,选择将生成式推理与确定性统计计算物理分离,并在两者之间嵌入11阶段的对抗性过滤。这与苹果去年8月为减少多模态模型幻觉、在不借助外部模型的情况下提出的基于偏差的采样方法,思路颇为相似。这两个案例都不是把模型做得更大,而是把验证流程编织得更加细密。
在实际业务中接触处理医疗健康数据的智能体系统时,总会卡在同一个环节:相关性很容易得出,但如果没有辨别其是偶然还是数据泄漏的程序,结果就无人信任。BDF让系统依次检验稳定性、泄漏、亚群体一致性和替代解释,正是正面应对这一问题的设计。不过,像ρ=0.126这样统计上显著但实际预测力较弱的指标也被列入候选,这也意味着该系统给出的结果,在没有人工复核程序的情况下,不能直接用于临床。
如果国内的医院或医疗健康初创企业正在处理可穿戴设备数据,这种多智能体架构值得借鉴的地方不在于模型选择,而在于流程设计:不把假设生成和统计验证交给同一个模型,而是拆分角色;并在结果交由人工审阅之前,明确设置必须通过的过滤环节。这两点是目前就可以立即应用的实务基准。
未来几个月内,这类以统计验证为核心的智能体很可能会被尝试应用到医疗以外的领域,比如金融异常检测或制造业质量管理。核心问题终归相同——比起快速提取看似合理的相关性的能力,能多细致地筛选出这种相关性是否属实,将成为下一阶段的竞争焦点。




评论