
요약
- 구글이 강화학습 기법 'ResidencyRL'로 Gemini 3.5 Flash를 훈련시켜 임상 상담 능력을 개선했다
- 81개 질환을 다루는 4만9870건의 가상 원격진료 상담이 훈련에 쓰였고 GRPO 방식의 보상 구조가 적용됐다
- 97명이 참여한 사람 평가에서 전반적 인상 88%, 정보 수집 완결성 91% 우세를 보였지만 환각 없음(12%)·처방 안전성(42%) 항목은 상대적으로 낮았다
- 훈련 방식
- ResidencyRL (강화학습, GRPO)
- 대상 모델
- Gemini 3.5 Flash
- 훈련 규모
- 81개 질환, 4만9870건 가상 원격진료 상담
- 시나리오 구성
- 일반 진료 83%, 병력 청취 15%, 까다로운 환자 대응 2%
- 사람 평가
- N=97, 전반적 인상 88% / 정보 수집 완결성 91% 우세
시뮬레이션 레지던시로 훈련된 제미나이
구글이 'ResidencyRL'이라는 강화학습 기법으로 Gemini 3.5 Flash를 훈련시켜 임상 상담 능력을 끌어올렸다. 훈련에는 81가지 질환을 다루는 4만9870건의 가상 원격진료 상담이 동원됐다. 실제 병원 레지던트가 수련을 거치듯, AI도 가상 환자를 상대로 반복 진료 경험을 쌓은 셈이다.
훈련 파이프라인은 나이·인종·거주지·성별 같은 인구통계 정보와 DDXPlus 감별진단 데이터셋, 신경성·우호성·외향성 같은 성격 특성을 조합해 시나리오를 만든다. 생성된 시나리오는 일반 진료(83%), 병력 청취(15%), 까다로운 환자 대응(2%) 세 유형으로 나뉘어 훈련에 쓰였다. 각 상담 에피소드는 최대 68개 행동과 사고 과정으로 구성되며, AI는 진단·처방·문진·의사소통·문서화·어투 여섯 항목에서 점수를 받고 지나치게 긴 답변이나 환각, 금기 처방에는 감점을 받는다. 이 보상 구조를 바탕으로 GRPO(그룹 상대 정책 최적화) 방식의 강화학습을 반복해 모델을 다듬었다.
RL로 임상 대화를 가르친다는 것
강화학습 기반 미세조정은 정답이 하나로 정해지지 않는 대화형 작업에 특히 유용하다. 의료 상담은 진단의 정확성뿐 아니라 환자에게 필요한 정보를 얼마나 놓치지 않고 물어보는지, 설명이 얼마나 이해하기 쉬운지까지 함께 평가돼야 한다. 이번 방식은 이 여러 기준을 하나의 보상 점수로 합쳐 모델이 스스로 균형을 찾도록 유도했다는 점에서, 단순히 정답 텍스트를 흉내내는 기존 미세조정과는 결이 다르다.
구글은 지난 8월 11일에도 의료 AI 연구 시스템 AMIE에 실시간 음성·영상 진료 상담 능력을 추가한 연구를 공개한 바 있다. AMIE는 표정이나 호흡 같은 비언어적 신호까지 읽어내는 데 초점을 맞춘 별개의 프로젝트로, 이번 ResidencyRL은 Gemini 3.5 Flash라는 별도 모델을 텍스트 기반 원격진료 상황에 특화해 훈련시킨 결과다. 두 프로젝트는 구글이 의료 상담용 AI를 여러 방향에서 동시에 다듬고 있음을 보여준다.

사람 평가에서는 우세, 안전성은 아직 숙제
평가자 97명이 참여한 비교 평가에서 ResidencyRL로 훈련된 모델은 전반적 인상 항목에서 88%의 우세를 기록했다. 정보 수집의 완결성에서도 91%가 이 모델을 선택했고, 진단 평가(66%)와 처방 적절성(75%)에서도 기존 모델보다 높은 평가를 받았다. 다만 환각 없음 항목에서는 우세 비율이 12%에 그쳤고, 처방 안전성에서도 42%로 상대적으로 낮았다. 진단·상담 능력은 눈에 띄게 좋아졌지만, 안전성 측면의 개선은 아직 더 필요하다는 뜻으로 읽힌다.
이번 결과는 의료 AI가 단순 정보 검색을 넘어 '진료 그 자체'를 흉내내는 방향으로 나아가고 있음을 보여준다. 다만 사람 평가에서도 환각과 처방 안전성 항목의 우세율이 낮게 나온 점은, 이런 모델이 실제 임상 현장에 투입되기 전 넘어야 할 문턱이 여전히 남아 있다는 신호로 봐야 한다.





댓글