METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Google Research 在 CDC 流感预测评估中排名第一

Google 用其 AI 研究工具 ERA 构建的流感住院预测模型,在 CDC 赛季评估的 39 个模型中得分最佳。它与第二名的差距为 0.02,各州排名则互有高下。

Google Research 在 CDC 流感预测评估中排名第一

图片:METAL

摘要

  • 在 CDC 于 9 月 30 日发布的 FluSight 2025-2026 赛季评估中,Google 的 Google_SAI-FluEns 在纳入分析的 39 个模型里位列团队单独提交模型第一。
  • Google 模型的相对 WIS 为 0.56,领先于得分 0.58 的三个模型和 CDC 集成预测(0.62,第 7 名),但在得克萨斯州、马萨诸塞州和康涅狄格州,其他模型表现更好。
  • 该预测模型由 Google 的 ERA 构建,ERA 利用 Gemini 编写并优化科学代码,已于 5 月以 Nature 论文形式发表。

Google Research 构建的流感住院预测模型,在美国疾病控制与预防中心(CDC)2025-2026 赛季流感预测评估中排名第一。CDC 在 9 月 30 日(当地时间)发布的 FluSight 赛季评估报告中表示,在纳入分析的 39 个模型中,Google 的 Google_SAI-FluEns 在团队单独提交的模型里成绩最好。Google 使用自家 AI 研究工具 Empirical Research Assistance(ERA)构建了这一预测模型。METAL 核对的 Google 公告原文共四段,没有说明模型使用了哪些输入数据。

FluSight 是 CDC 的一个项目,它收集学界、业界和政府预测团队每周提交的流感住院人数预测,并将其合并为一个预测。本赛季的提交期从 2025 年 11 月 22 日持续到 2026 年 5 月 20 日,预测自 2025 年 12 月 12 日起在 FluSight 网页上公布。各团队需要针对 50 个州、华盛顿特区和全美,预测当周及最多三周后的住院人数。CDC 每周用合并后的预测来传达各州医疗服务需求的预期。除流感活动有限的 2020-2021 赛季外,CDC 自 2013-2014 赛季起每年都举办这项预测挑战。

本赛季共有 34 个团队提交了 53 个模型,提交了至少 75% 预测目标的 39 个模型被纳入评估。主要评分指标是相对加权区间得分(WIS)。它衡量预测区间与实际观测值的吻合程度,以把上周住院人数原样延续到下周的基准模型为 1,低于 1 即表示预测优于基准。39 个模型中有 33 个优于基准模型。

在 CDC 报告表 1 中,Google 模型的相对 WIS 最低,为 0.56。OHT_JHU-nbxd、CMU-TimeSeries 和 UGA_flucast-INFLAenza 以 0.58 紧随其后,UMass-flusion 为 0.59。Google 模型 50% 预测区间的覆盖率为 51.2%,95% 预测区间的覆盖率为 93.72%,分别接近 50% 和 95% 的目标值,并提交了全部预测目标的 98%。CDC 发布预测信息时使用的 FluSight 集成预测得分 0.62,排名第 7。

按州来看,排名出现分化。在同一报告的辖区表中,Google 模型在加利福尼亚州得分 0.37、得克萨斯州 0.42、北卡罗来纳州 0.45。在得克萨斯州,NEU_ISI-AdaptiveEnsemble(0.35)、NAU-vulPES(0.40)和 UMass-flusion(0.41)得分低于 Google;在马萨诸塞州和康涅狄格州,CMU-TimeSeries 以 0.37 和 0.40 领先于 Google 的 0.51 和 0.59。CDC 集成预测是在所有辖区都稳定优于基准的 12 个模型之一。

CDC FluSight 2025~2026 시즌 평가 표 1. 상대 WIS가 낮은 순으로 Google_SAI-FluEns 0.56, OHT_JHU-nbxd·CMU-TimeSeries·UGA_flucast-INFLAenza 0.58, FluSight 앙상블 0.62가 나온다

这个赛季本身也很难预测。CDC 将本赛季定为中等程度,每周住院人数最高超过 4 万人。住院人数自 2025 年 11 月中旬开始上升,在截至 12 月 27 日的那一周达到全国峰值。CDC 在报告中表示,集成预测"可能并不总能可靠地预测疾病趋势的快速变化"。实际上,集成预测的 50% 和 95% 预测区间没能跟上 12 月底的激增和 1 月中旬的骤降;在峰值周,各辖区提前两周的预测区间包含实际值的比例不到 25%。集成预测的覆盖率自 2026 年 2 月起稳定在 95% 左右。

Google 模型背后的 ERA 是一款利用 Gemini 编写和优化科学代码的研究工具。Google 于 2026 年 5 月 19 日在 Nature 上发表论文《AI system designed to help scientists write expert-level empirical software》,正式介绍了 ERA。给定科学问题和成功标准后,ERA 会检索文献、编写代码、探索解法、组合技术并评估结果。它采用树搜索方法权衡数千种选项,使代码朝目标不断完善。论文报告称,ERA 在基因组学、公共卫生、卫星图像分析、神经科学预测、时间序列预测和数学等基准上都达到了专家级水平。Google Research 产品经理 Lizzie Dorfman 和研究科学家 Michael Brenner 表示:"提高科学发现的速度和范围,是 AI 可能为人类带来的最大潜在益处之一。"

传染病预测是 ERA 的代表性应用。据 Google Research 介绍,用 ERA 构建的模型以州为单位,提前最多四周预测流感、COVID-19 和呼吸道合胞病毒(RSV)的每周住院人数,在三种病毒的 CDC 公开排行榜上均位居前列。据报道,研究人员在 5 月 15 日的预印本中描述了由大语言模型引导树搜索、编写、测试并修改预测软件的结构,并报告称在实时前瞻性评估中,由机器生成模型组成的集成预测表现与 CDC 人工组建的中心集成预测相当或更好。研究人员称,在几乎没有数据的起步条件下,它对 RSV 的预测也给出了可用结果。传染病预测研究由 Zahra Shamsi、Sarah Martinson、Nicholas Reich、Martyna Plomecka 和 Brian Williams 领导。

ERA 也被用于传染病以外的领域。Google 表示,用 ERA 构建的加利福尼亚州融雪径流预测模型,比该州官方供水展望 Bulletin 120 更早给出更准确的预测。它还推出了利用 GOES-East 静止气象卫星数据每 10 分钟估算一次二氧化碳浓度的模型,以及可与芝加哥联储零售销售预测相媲美的零售预测模型。ERA 的底层技术作为试点科学工具提供给受信任的测试者,Google 还在 Gemini for Science 中以试点工具形式开放由 ERA 和 AlphaEvolve 构建的 Computational Discovery。METAL 此前曾报道 Google 推出面向研究的 AI 工具 Gemini for Science。

ERA로 만든 구글 예측의 독감·코로나19·RSV 실시간 예측과 실제 입원 수 비교, CDC 예측 허브 안 모델별 상대 로그 WIS 순위를 보여 주는 구글 리서치 도표

撰写这篇预测模型文章的 Google Research 研究员 Zahra Shamsi 表示:"这一成绩证实了我们的信心:AI 与人类智慧相结合,将提升我们在全球范围内预测疾病的能力。"第一名与第二名的相对 WIS 差距为 0.02,各州排名也互有高下。尽管如此,在一项长期由人类打磨统计和机理模型的竞赛中,由 AI 编写和修改的预测代码登上了一个赛季成绩单的榜首。CDC 即将发布同一赛季流感急诊就诊比例预测的评估。

评论