
이미지: X — 뉴스 앰프 화면 갈무리
摘要
- 谷歌利用强化学习技术"ResidencyRL"对Gemini 3.5 Flash进行训练,以提升其临床问诊能力
- 训练数据包含涵盖81种疾病的49870次虚拟远程问诊案例,并采用了GRPO方式的奖励结构
- 在97人参与的人工评估中,整体印象胜出率为88%,信息收集完整性胜出率为91%,但无幻觉率(12%)和处方安全性(42%)相对较低
- 훈련 방식
- ResidencyRL (강화학습, GRPO)
- 대상 모델
- Gemini 3.5 Flash
- 훈련 규모
- 81개 질환, 4만9870건 가상 원격진료 상담
- 시나리오 구성
- 일반 진료 83%, 병력 청취 15%, 까다로운 환자 대응 2%
- 사람 평가
- N=97, 전반적 인상 88% / 정보 수집 완결성 91% 우세
通过模拟住院医师培训锻炼出的Gemini
谷歌采用名为"ResidencyRL"的强化学习技术对Gemini 3.5 Flash进行训练,以提升其临床问诊能力。训练过程动用了涵盖81种疾病的49870次虚拟远程问诊案例。就像真正的医院住院医师要经历反复的临床训练一样,AI也通过与虚拟患者反复问诊积累了"诊疗经验"。
训练流程会结合年龄、种族、居住地、性别等人口统计信息,DDXPlus鉴别诊断数据集,以及神经质、亲和性、外向性等人格特质来生成场景。生成的场景分为一般诊疗(83%)、病史采集(15%)、应对棘手患者(2%)三种类型,分别用于训练。每次问诊环节最多包含68个行动和思考过程,AI会在诊断、处方、问诊、沟通、记录、语气六个方面获得评分,对过长的回答、幻觉内容以及禁忌处方则会被扣分。基于这一奖励结构,系统反复运用GRPO(组相对策略优化)强化学习方式对模型进行调优。

用强化学习教授临床对话意味着什么
基于强化学习的微调方法,对于没有唯一标准答案的对话类任务尤为有用。医疗问诊不仅要评估诊断的准确性,还需要同时考量是否充分询问了患者所需的各类信息、说明是否通俗易懂。这种方法将多项评价标准整合为单一的奖励分数,引导模型自行寻找平衡点,这与单纯模仿标准答案文本的传统微调方式有本质区别。
谷歌此前在8月11日也公开过一项研究,为其医疗AI研究系统AMIE增加了实时语音·视频问诊能力。AMIE是专注于读取表情、呼吸等非语言信号的独立项目,而此次的ResidencyRL则是针对Gemini 3.5 Flash这一独立模型、专门为基于文本的远程问诊场景进行训练的成果。这两个项目表明,谷歌正在从多个方向同时打磨面向医疗问诊的AI。
人工评估中表现占优,但安全性仍是待解课题
在97名评估者参与的对比评估中,经ResidencyRL训练的模型在整体印象项目上取得了88%的胜出率。在信息收集完整性方面,91%的评估者选择了该模型;在诊断评估(66%)和处方适当性(75%)方面,该模型也获得了高于既有模型的评价。不过在无幻觉率项目上,胜出率仅为12%,处方安全性方面也相对较低,仅为42%。这意味着诊断和问诊能力有了明显提升,但在安全性方面的改进仍有待加强。
这一结果表明,医疗AI正朝着不止于简单信息检索、而是"模拟诊疗本身"的方向发展。不过,人工评估中幻觉和处方安全性项目的胜出率偏低也提醒我们,这类模型在真正投入临床应用之前,仍有一些门槛尚待跨越。



