
摘要
- 微软研究院介绍了胸部X光判读系统CARE-X,公开了结合灵活推理、经过校准的预测以及基于测量的工具的架构
- 该系统由编排器(Orchestrator)判断是否需要调用工具,VLM(视觉-语言模型)助手测量心脏宽度和胸廓宽度,从而计算心胸比(CTR)
- 在示例图像中,系统测得心脏宽度为0.408、胸廓宽度为0.752,算出CTR为0.54,该数值落在用于判定心脏肥大的临床阈值0.50~0.55区间内
X光片上画出的两把尺子
微软研究院公开的一张示意图中,两条测量线叠加在一张胸部X光片上。一条测量心脏的最大宽度,另一条测量整个胸廓的宽度。两个数值相除得出的结果就是心胸比(CTR,cardiothoracic ratio)——即心脏在胸廓中所占的比例,这是判断心脏是否异常增大的传统临床指标。微软研究院于8月11日通过其官方X账号介绍了应用这一方法的系统"CARE-X"。
在公开的示例中,系统测得心脏宽度为0.408、胸廓宽度为0.752,算出CTR为0.54。临床上通常将超过0.5视为疑似心脏肥大(cardiomegaly)的表现,而该数值正处于这一临界点附近。系统没有仅以文字给出诊断结论,而是将支撑判断的数值直接画在画面上呈现出来。
编排器与VLM,两层判读结构
CARE-X的结构分为两层。用户输入图像和问题后,编排器接收并将提示词传递给助手VLM(视觉-语言模型,即同时处理图像和文本的模型)。助手首先识别拍摄方向(PA/AP,即后前位、前后位),若判断需要调用工具,则执行cardiac_width、thoracic_width、compute_ctr等函数。结果返回给编排器后,若判断不再需要额外调用工具,则整理成最终报告交付给用户。
| 阶段 | 负责主体 | 处理内容 |
|---|---|---|
| 输入 | 用户 | 图像+提问 |
| 判断 | 编排器(Orchestrator) | 调用VLM,分支判断是否需要工具 |
| 感知 | 助手VLM | 判别拍摄视角,应用0.50/0.55阈值 |
| 测量 | 工具调用 | cardiac_width、thoracic_width、compute_ctr |
| 综合 | 助手VLM | 同时给出诊断结论与数值 |
将测量值本身整理成表格后,与阈值之间的距离也更加清晰。
| 项目 | 数值 |
|---|---|
| 心脏宽度 | 0.408 |
| 胸廓宽度 | 0.752 |
| CTR计算值 | 0.54 |
| 应用阈值 | 0.50 / 0.55 |
从生成判读文本到可验证的依据
迄今为止,用于胸部X光的AI大多是看图后一次性生成整篇判读文本。问题在于,这些文字是基于什么依据得出的很难追溯。CARE-X所强调的正是"基于测量的工具"这一表述所指的结构——在得出诊断之前,留下可计算的中间数值。这意味着医生不再只是接收判读文本、判断对错,而是可以同时确认心脏宽度、胸廓宽度这样具体的数值以及计算过程。编排器自行判断是否需要调用工具这一点也值得注意。这似乎表明,系统并非对所有图像都强制执行相同的计算,而是将只在必要时才调用测量工具的灵活推理机制内置于系统之中。
医疗AI从单纯生成文本走向留下结构化依据的趋势,并不只体现在CARE-X上。谷歌研究院也于8月11日宣布,为其医疗AI研究系统AMIE增加了实时语音、视频问诊咨询功能,这同样是试图将患者的表情、呼吸等此前仅靠文本对话难以捕捉的非语言信号纳入系统的尝试。尽管方式不同,但这两个案例的共同点在于:AI不再只是给出结果,而是将重点放在如何留下判断过程、使其可被验证。
那么,这意味着什么改变
CARE-X实际精度如何、以何种数据集进行了验证,仅凭此次发布内容尚无法确认。但这一架构所指向的方向是明确的。如果AI在看胸部X光时,能够给出"心脏宽度0.408、胸廓宽度0.752、CTR为0.54"这样的计算过程,而不是仅仅一句"心脏看起来偏大",医护人员就能够对该判断进行重新计算,或依据其他标准重新审视。对于正考虑引入判读辅助AI的医院或研究机构而言,下一步的评估标准很可能不再是"结果"本身,而是其"依据结构"是如何设计的。





评论