
이미지: METAL
요약
- CDC가 9월 30일 공개한 FluSight 2025~2026 시즌 평가에서 구글의 Google_SAI-FluEns가 분석 대상 39개 모델 중 개별 팀 제출 모델 1위를 차지했다.
- 구글 모델의 상대 WIS는 0.56으로, 0.58을 받은 세 모델과 CDC 앙상블(0.62·7위)을 앞섰지만 텍사스·매사추세츠·코네티컷에서는 다른 모델이 더 나았다.
- 예측 모델은 제미나이로 과학 코드를 쓰고 최적화하는 구글의 ERA로 만들었고, ERA는 5월 네이처 논문으로 공개됐다.
- 발표
- 2026년 9월 30일 · CDC FluSight 2025-2026 평가 보고서 · 구글 블로그(자흐라 샴시)
- 1위 모델
- Google_SAI-FluEns · 상대 WIS 0.56
- 평가 대상
- 34개 팀 · 53개 모델 제출 · 기준 충족 39개(예측 대상 75% 이상 제출)
- 추격 모델
- OHT_JHU-nbxd·CMU-TimeSeries·UGA_flucast-INFLAenza 0.58 · UMass-flusion 0.59
- CDC 앙상블
- FluSight-ensemble 0.62 · 7위 · 전 지역에서 기준 모델을 꾸준히 이긴 12개 모델 중 하나
- 기준 모델 상회
- 39개 중 33개
- 구글 모델 적중률
- 50% 구간 51.2% · 95% 구간 93.72% · 제출률 98%
- 주별 점수
- 캘리포니아 0.37 · 텍사스 0.42 · 노스캐롤라이나 0.45 · 매사추세츠 0.51 · 코네티컷 0.59
- 주별 역전
- 텍사스 NEU_ISI-AdaptiveEnsemble 0.35 · 매사추세츠 CMU-TimeSeries 0.37 · 코네티컷 CMU-TimeSeries 0.40
- 접수 기간
- 2025년 11월 22일 ~ 2026년 5월 20일 · 첫 공개 2025년 12월 12일
- 예측 범위
- 50개 주·워싱턴 D.C.·전국 · 이번 주~3주 뒤
- 시즌
- 보통 수준 · 주간 최고 입원 4만 명 이상 · 정점 2025년 12월 27일로 끝나는 주
- 정점 주 적중
- 2주 앞 예측 구간이 실제 값을 담은 비율 25% 미만 · 2026년 2월부터 95% 근처
- 대회 연혁
- 2013~2014 시즌부터 매년(2020~2021 제외)
- ERA
- 제미나이로 과학 코드를 쓰고 최적화 · 트리 탐색으로 수천 가지 선택지 검토
- 네이처 논문
- 2026년 5월 19일 · AI system designed to help scientists write expert-level empirical software
- 감염병 적용
- 독감·코로나19·RSV 주별 입원 최대 4주 앞 예측 · CDC 리더보드 최상위권
- 사전 논문
- 5월 15일 · 기계 생성 모델 앙상블이 CDC 허브 앙상블과 같거나 우수 (보도)
- 다른 적용
- 캘리포니아 유출 예측(Bulletin 120 대비) · GOES-East 이산화탄소 10분 단위 추정 · 소매판매 예측
- 제품화
- ERA·AlphaEvolve 기반 Computational Discovery · Gemini for Science 실험 도구 · 신뢰 테스터 제공
구글 리서치가 만든 독감 입원 예측 모델이 미국 질병통제예방센터(CDC)의 2025~2026 시즌 독감 예측 평가에서 1위에 올랐다. CDC는 9월 30일(현지시간) 공개한 FluSight 시즌 평가 보고서에서 분석 대상 39개 모델 가운데 구글의 Google_SAI-FluEns가 개별 팀 제출 모델 중 가장 좋은 성적을 냈다고 밝혔다. 구글은 이 예측 모델을 자사 AI 연구 도구인 Empirical Research Assistance(ERA)로 만들었다. 메탈이 확인한 구글 발표문 원문은 네 문단 분량으로, 모델이 어떤 입력 자료를 썼는지는 적지 않았다.
FluSight는 CDC가 학계와 업계, 정부의 예측 팀에서 주별 독감 입원 환자 수 예측을 받아 하나로 묶는 사업이다. 이번 시즌 접수는 2025년 11월 22일부터 2026년 5월 20일까지 이어졌고, 예측은 2025년 12월 12일부터 FluSight 웹페이지에 공개됐다. 각 팀은 50개 주와 워싱턴 D.C., 미국 전체를 대상으로 이번 주와 최대 3주 뒤의 입원 환자 수를 내야 했다. CDC는 묶은 예측을 매주 주 단위 의료 수요 전망을 알리는 데 쓴다. CDC는 독감 유행이 미미했던 2020~2021 시즌을 빼고 2013~2014 시즌부터 해마다 이 예측 대회를 열어 왔다.
이번 시즌에는 34개 팀이 53개 모델을 냈고, 예측 대상의 75% 이상을 제출한 39개 모델이 평가에 들어갔다. 채점의 주된 잣대는 상대 가중구간점수(WIS)다. 예측 구간이 실제 관측값과 얼마나 맞아떨어졌는지를 재는 지표로, 지난주 입원 환자 수를 그대로 다음 주로 옮기는 기준 모델을 1로 놓고 1보다 낮으면 기준보다 나은 예측이다. 39개 모델 가운데 33개가 기준 모델을 이겼다.
CDC 보고서 표 1에서 구글 모델의 상대 WIS는 0.56으로 가장 낮았다. OHT_JHU-nbxd와 CMU-TimeSeries, UGA_flucast-INFLAenza가 0.58로 뒤를 이었고 UMass-flusion은 0.59였다. 구글 모델의 50% 예측 구간 적중률은 51.2%, 95% 예측 구간 적중률은 93.72%로 각각 목표치인 50%와 95%에 가까웠고, 전체 예측 대상의 98%를 제출했다. CDC가 실제 예측 메시지를 낼 때 쓰는 FluSight 앙상블은 0.62로 7위였다.
주별로 보면 순위는 갈린다. 같은 보고서의 관할 지역별 표에서 구글 모델은 캘리포니아 0.37, 텍사스 0.42, 노스캐롤라이나 0.45를 기록했다. 텍사스에서는 NEU_ISI-AdaptiveEnsemble(0.35)과 NAU-vulPES(0.40), UMass-flusion(0.41)이 구글보다 낮은 점수를 냈고, 매사추세츠와 코네티컷에서는 CMU-TimeSeries가 0.37과 0.40으로 구글의 0.51과 0.59를 앞섰다. CDC 앙상블은 모든 관할 지역에서 기준 모델을 꾸준히 이긴 12개 모델 가운데 하나였다.

시즌 자체도 예측이 까다로웠다. CDC는 이번 시즌을 보통 수준으로 분류했고, 주간 입원 환자 수는 최고 4만 명을 넘었다. 입원은 2025년 11월 중순부터 늘기 시작해 12월 27일로 끝나는 주에 전국 정점을 찍었다. CDC는 보고서에서 앙상블 예측이 "질병 추세의 급격한 변화를 언제나 믿을 만하게 예측하지는 못할 수 있다"고 밝혔다. 실제로 앙상블의 50%·95% 예측 구간은 12월 말 급증과 1월 중순 급감을 따라가지 못했고, 정점 주에는 2주 앞 예측 구간이 실제 값을 담은 비율이 지역 전체에서 25%에 못 미쳤다. 앙상블의 적중률은 2026년 2월부터 95% 근처에서 안정됐다.
구글 모델 뒤에 있는 ERA는 제미나이로 과학 코드를 쓰고 최적화하는 연구 도구다. 구글은 2026년 5월 19일 네이처에 실린 논문 「AI system designed to help scientists write expert-level empirical software」로 ERA를 정식 공개했다. 과학 문제와 성공 척도를 주면 ERA는 문헌을 찾고, 코드를 쓰고, 해법을 탐색하고, 기법을 조합한 뒤 결과를 평가한다. 트리 탐색 방식으로 수천 가지 선택지를 따져 목표에 맞게 코드를 다듬는다. 논문은 유전체학, 공중보건, 위성영상 분석, 신경과학 예측, 시계열 예측, 수학 벤치마크 전반에서 ERA가 전문가 수준 성능을 냈다고 보고했다. 리지 도프먼 구글 리서치 프로덕트 매니저와 마이클 브레너 연구과학자는 "과학적 발견의 속도와 범위를 넓히는 일은 AI가 인류에 줄 수 있는 가장 큰 잠재적 혜택 가운데 하나"라고 밝혔다.
감염병 예측은 ERA의 대표 적용 사례다. 구글 리서치에 따르면 ERA로 만든 모델은 독감과 코로나19, 호흡기세포융합바이러스(RSV)의 주간 입원 환자 수를 주(州) 단위로 최대 4주 앞까지 예측했고, 세 바이러스 모두 CDC 공개 리더보드에서 최상위권에 들었다. 보도에 따르면 연구진은 5월 15일 사전 논문에서 대형언어모델이 트리 탐색을 이끌며 예측 소프트웨어를 쓰고 시험하고 고치는 구조를 설명했고, 실시간 전향 평가에서 기계가 만든 모델들의 앙상블이 CDC가 사람 손으로 꾸린 허브 앙상블과 같거나 더 나은 성적을 냈다고 보고했다. 자료가 거의 없는 상태에서 출발하는 RSV 예측에서도 쓸 만한 결과를 냈다는 것이 연구진 주장이다. 감염병 예측 연구는 자흐라 샴시, 세라 마틴슨, 니컬러스 라이크, 마르티나 플로메츠카, 브라이언 윌리엄스가 이끌었다.
ERA는 감염병 밖에서도 쓰이고 있다. 구글은 ERA로 만든 캘리포니아 눈 녹은 물 유출 예측 모델이 주 정부의 공식 수자원 전망인 Bulletin 120보다 이른 시점에 더 정확한 예측을 냈다고 밝혔다. 정지궤도 기상위성 GOES-East 자료로 이산화탄소 농도를 10분마다 추정하는 모델과, 시카고 연방준비은행의 소매판매 예측과 견줄 만한 소매 예측 모델도 내놨다. ERA 기반 기술은 신뢰 테스터에게 시범용 과학 도구로 제공되고, 구글은 ERA와 AlphaEvolve로 만든 Computational Discovery를 Gemini for Science 시범 도구로 열고 있다. 메탈은 구글이 연구용 AI 제미나이 포 사이언스를 공개했다고 보도한 바 있다.

예측 모델 글을 쓴 구글 리서치의 자흐라 샴시는 "이번 성과는 AI와 인간의 독창성이 결합하면 전 세계 질병 예측 능력이 나아질 것이라는 우리의 확신을 뒷받침한다"고 밝혔다. 1위와 2위의 점수 차는 상대 WIS 0.02이고 주별 순위는 엇갈렸다. 그래도 통계와 기계론 모형을 사람이 다듬어 온 경쟁에서, AI가 쓰고 고친 예측 코드가 한 시즌 성적표 맨 위에 올랐다. CDC는 같은 시즌 독감 응급실 방문 비율 예측에 대한 평가를 곧 내놓는다.
출처
- Google — Google's science AI ranks #1 in CDC evaluation →
- CDC — FluSight 2025-2026 Evaluation →
- Google Research — Empirical Research Assistance (ERA): From Nature publication to catalyzing Computational Discovery →
- Unite.AI — Google AI Model Tops CDC Evaluation of Flu Hospitalization Forecasts →
- Google Research (X) — Today the @CDCgov announced that of 39 eligible models, Google's science AI model ranked highest →





댓글