每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

谷歌通过虚拟住院医师培训强化Gemini诊疗能力

ResidencyRL:基于81种疾病、5万次虚拟问诊对Gemini 3.5 Flash进行强化学习

의료 AI 시뮬레이션 훈련 파이프라인과 성능 평가 결과를 보여주는 다이어그램

이미지: X — 뉴스 앰프 화면 갈무리

摘要

  • 谷歌利用强化学习技术"ResidencyRL"对Gemini 3.5 Flash进行训练,以提升其临床问诊能力
  • 训练数据包含涵盖81种疾病的49870次虚拟远程问诊案例,并采用了GRPO方式的奖励结构
  • 在97人参与的人工评估中,整体印象胜出率为88%,信息收集完整性胜出率为91%,但无幻觉率(12%)和处方安全性(42%)相对较低
훈련 방식
ResidencyRL (강화학습, GRPO)
대상 모델
Gemini 3.5 Flash
훈련 규모
81개 질환, 4만9870건 가상 원격진료 상담
시나리오 구성
일반 진료 83%, 병력 청취 15%, 까다로운 환자 대응 2%
사람 평가
N=97, 전반적 인상 88% / 정보 수집 완결성 91% 우세

通过模拟住院医师培训锻炼出的Gemini

谷歌采用名为"ResidencyRL"的强化学习技术对Gemini 3.5 Flash进行训练,以提升其临床问诊能力。训练过程动用了涵盖81种疾病的49870次虚拟远程问诊案例。就像真正的医院住院医师要经历反复的临床训练一样,AI也通过与虚拟患者反复问诊积累了"诊疗经验"。

训练流程会结合年龄、种族、居住地、性别等人口统计信息,DDXPlus鉴别诊断数据集,以及神经质、亲和性、外向性等人格特质来生成场景。生成的场景分为一般诊疗(83%)、病史采集(15%)、应对棘手患者(2%)三种类型,分别用于训练。每次问诊环节最多包含68个行动和思考过程,AI会在诊断、处方、问诊、沟通、记录、语气六个方面获得评分,对过长的回答、幻觉内容以及禁忌处方则会被扣分。基于这一奖励结构,系统反复运用GRPO(组相对策略优化)强化学习方式对模型进行调优。

이미지: X — 뉴스 앰프

用强化学习教授临床对话意味着什么

基于强化学习的微调方法,对于没有唯一标准答案的对话类任务尤为有用。医疗问诊不仅要评估诊断的准确性,还需要同时考量是否充分询问了患者所需的各类信息、说明是否通俗易懂。这种方法将多项评价标准整合为单一的奖励分数,引导模型自行寻找平衡点,这与单纯模仿标准答案文本的传统微调方式有本质区别。

谷歌此前在8月11日也公开过一项研究,为其医疗AI研究系统AMIE增加了实时语音·视频问诊能力。AMIE是专注于读取表情、呼吸等非语言信号的独立项目,而此次的ResidencyRL则是针对Gemini 3.5 Flash这一独立模型、专门为基于文本的远程问诊场景进行训练的成果。这两个项目表明,谷歌正在从多个方向同时打磨面向医疗问诊的AI。

人工评估中表现占优,但安全性仍是待解课题

在97名评估者参与的对比评估中,经ResidencyRL训练的模型在整体印象项目上取得了88%的胜出率。在信息收集完整性方面,91%的评估者选择了该模型;在诊断评估(66%)和处方适当性(75%)方面,该模型也获得了高于既有模型的评价。不过在无幻觉率项目上,胜出率仅为12%,处方安全性方面也相对较低,仅为42%。这意味着诊断和问诊能力有了明显提升,但在安全性方面的改进仍有待加强。

这一结果表明,医疗AI正朝着不止于简单信息检索、而是"模拟诊疗本身"的方向发展。不过,人工评估中幻觉和处方安全性项目的胜出率偏低也提醒我们,这类模型在真正投入临床应用之前,仍有一些门槛尚待跨越。