
요약
- 마이크로소프트 리서치가 흉부 엑스레이 판독 시스템 CARE-X를 소개하며 유연한 추론, 보정된 예측, 측정 기반 도구를 결합한 구조를 공개했다
- 시스템은 오케스트레이터가 도구 호출 여부를 판단하고, VLM(비전-언어 모델) 어시스턴트가 심장 폭·흉곽 폭을 측정해 심흉비(CTR)를 계산하는 방식으로 작동한다
- 예시 이미지에서는 심장 폭 0.408, 흉곽 폭 0.752를 측정해 CTR 0.54를 산출했으며, 이는 심비대 판정에 쓰이는 임상 임계값 0.50~0.55 구간에 걸쳐 있다
- 발표
- Microsoft Research, 2026년 8월 11일 X 게시
- 시스템명
- CARE-X
- 핵심 결합 요소
- 유연한 추론 + 보정된 예측 + 측정 기반 도구
- 구조
- Orchestrator(도구 호출 판단) + Assistant-VLM(지각·도구 호출·종합)
- 도구 함수
- cardiac_width, thoracic_width, compute_ctr
- 예시 계산값
- 심장 폭 0.408 / 흉곽 폭 0.752 → CTR 0.54
- 적용된 임계값
- 0.50 / 0.55
엑스레이 위에 그려진 두 개의 자
마이크로소프트 리서치가 공개한 다이어그램 한 장에는 흉부 엑스레이 사진 위에 두 개의 측정선이 겹쳐 있다. 하나는 심장의 가장 넓은 폭을, 다른 하나는 흉곽 전체 폭을 잰다. 두 값을 나누면 나오는 숫자가 심흉비(CTR, cardiothoracic ratio) — 심장이 흉곽에서 차지하는 비율로, 심장이 비정상적으로 커졌는지를 가늠하는 오래된 임상 지표다. 마이크로소프트 리서치는 지난 8월 11일 공식 X 계정을 통해 이 접근을 적용한 시스템 'CARE-X'를 소개했다.
공개된 예시에서는 심장 폭 0.408, 흉곽 폭 0.752를 측정해 CTR 0.54를 산출했다. 임상에서 통상 0.5를 넘으면 심비대(cardiomegaly) 의심 소견으로 다루는데, 이 수치는 그 경계에 걸쳐 있다. 진단명을 문장으로만 내놓는 대신, 근거가 되는 숫자를 화면에 그려 보여주는 셈이다.
오케스트레이터와 VLM, 두 층위의 판독
CARE-X의 구조는 두 개의 층으로 나뉜다. 사용자가 이미지와 질문을 입력하면 오케스트레이터가 이를 받아 어시스턴트 VLM(비전-언어 모델·이미지와 텍스트를 함께 처리하는 모델)에 프롬프트를 전달한다. 어시스턴트는 우선 촬영 방향(PA/AP, 후전방·전후방)을 지각한 뒤, 도구 호출이 필요하다고 판단하면 cardiac_width·thoracic_width·compute_ctr 같은 함수를 실행한다. 이 결과가 오케스트레이터에 돌아오면, 추가 도구 호출이 필요 없다고 판단될 때 최종 보고서로 정리해 사용자에게 전달한다.
| 단계 | 담당 | 처리 내용 |
|---|---|---|
| 입력 | User | 이미지 + 질의 |
| 판단 | Orchestrator | VLM 호출, 도구 필요 여부 분기 |
| 지각 | Assistant-VLM | 촬영 뷰 판별, 임계값 0.50/0.55 적용 |
| 측정 | 도구 호출 | cardiac_width, thoracic_width, compute_ctr |
| 종합 | Assistant-VLM | 진단과 수치를 함께 제시 |
측정값 자체도 표로 정리하면 임계값과의 거리가 뚜렷하게 드러난다.
| 항목 | 값 |
|---|---|
| 심장 폭 | 0.408 |
| 흉곽 폭 | 0.752 |
| CTR 계산값 | 0.54 |
| 적용 임계값 | 0.50 / 0.55 |
판독문 생성에서 검증 가능한 근거로
지금까지 흉부 엑스레이용 AI 대부분은 이미지를 보고 판독문 한 편을 통째로 써내는 방식이었다. 문제는 그 문장이 어떤 근거로 나왔는지 되짚기 어렵다는 점이다. CARE-X가 강조하는 것은 '측정 기반 도구'라는 표현대로, 진단 이전에 계산 가능한 중간 값을 남기는 구조다. 의사가 판독문만 받아 옳고 그름을 판단하는 게 아니라, 심장 폭과 흉곽 폭이라는 구체적인 수치와 계산 과정을 함께 확인할 수 있다는 뜻이다. 오케스트레이터가 도구 호출 여부를 스스로 분기하는 방식도 눈에 띈다. 모든 이미지에 똑같은 계산을 강제하는 대신, 필요할 때만 측정 도구를 불러 쓰는 유연한 추론을 시스템에 내재시켰다는 의미로 읽힌다.
의료 AI가 텍스트 생성을 넘어 구조화된 근거를 남기는 방향으로 가는 흐름은 CARE-X만의 이야기는 아니다. 구글 리서치도 지난 8월 11일 의료 AI 연구 시스템 AMIE에 실시간 음성·영상 진료 상담 기능을 더했다고 발표했는데, 이 역시 텍스트 기반 대화만으로는 놓치던 환자의 표정·호흡 같은 비언어적 신호를 시스템에 담으려는 시도였다. 접근 방식은 다르지만, 두 사례 모두 AI가 결과만 내놓는 게 아니라 판단의 과정을 어떻게 남기고 검증 가능하게 만들 것인가에 초점을 맞추고 있다는 공통점이 있다.
그래서 무엇이 달라지나
CARE-X가 실제로 얼마나 정확한지, 어떤 데이터셋으로 검증됐는지는 이번 게시물만으로는 확인되지 않았다. 다만 이 구조가 시사하는 방향은 뚜렷하다. AI가 흉부 엑스레이를 보고 '심장이 커 보인다'는 문장 대신 '심장 폭 0.408, 흉곽 폭 0.752, CTR 0.54'라는 계산 과정을 제시할 수 있다면, 의료진은 그 판단을 재계산하거나 다른 기준으로 재검토할 여지를 얻는다. 판독 보조 AI를 도입하려는 병원이나 연구기관에는 '결과'가 아니라 '근거 구조'를 어떻게 설계했는지가 다음 평가 기준이 될 가능성이 크다.





댓글