METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

微软研究院公开CARE-X,可直接计算胸部X光心胸比

不止于生成判读文本,还提出测量心脏与胸廓宽度、计算CTR的方式

微软研究院公开CARE-X,可直接计算胸部X光心胸比

摘要

  • 微软研究院介绍了胸部X光判读系统CARE-X,公开了结合灵活推理、经过校准的预测以及基于测量的工具的架构
  • 该系统由编排器(Orchestrator)判断是否需要调用工具,VLM(视觉-语言模型)助手测量心脏宽度和胸廓宽度,从而计算心胸比(CTR)
  • 在示例图像中,系统测得心脏宽度为0.408、胸廓宽度为0.752,算出CTR为0.54,该数值落在用于判定心脏肥大的临床阈值0.50~0.55区间内
原文视频

X光片上画出的两把尺子

微软研究院公开的一张示意图中,两条测量线叠加在一张胸部X光片上。一条测量心脏的最大宽度,另一条测量整个胸廓的宽度。两个数值相除得出的结果就是心胸比(CTR,cardiothoracic ratio)——即心脏在胸廓中所占的比例,这是判断心脏是否异常增大的传统临床指标。微软研究院于8月11日通过其官方X账号介绍了应用这一方法的系统"CARE-X"。

在公开的示例中,系统测得心脏宽度为0.408、胸廓宽度为0.752,算出CTR为0.54。临床上通常将超过0.5视为疑似心脏肥大(cardiomegaly)的表现,而该数值正处于这一临界点附近。系统没有仅以文字给出诊断结论,而是将支撑判断的数值直接画在画面上呈现出来。

编排器与VLM,两层判读结构

CARE-X的结构分为两层。用户输入图像和问题后,编排器接收并将提示词传递给助手VLM(视觉-语言模型,即同时处理图像和文本的模型)。助手首先识别拍摄方向(PA/AP,即后前位、前后位),若判断需要调用工具,则执行cardiac_width、thoracic_width、compute_ctr等函数。结果返回给编排器后,若判断不再需要额外调用工具,则整理成最终报告交付给用户。

阶段负责主体处理内容
输入用户图像+提问
判断编排器(Orchestrator)调用VLM,分支判断是否需要工具
感知助手VLM判别拍摄视角,应用0.50/0.55阈值
测量工具调用cardiac_width、thoracic_width、compute_ctr
综合助手VLM同时给出诊断结论与数值

将测量值本身整理成表格后,与阈值之间的距离也更加清晰。

项目数值
心脏宽度0.408
胸廓宽度0.752
CTR计算值0.54
应用阈值0.50 / 0.55

从生成判读文本到可验证的依据

迄今为止,用于胸部X光的AI大多是看图后一次性生成整篇判读文本。问题在于,这些文字是基于什么依据得出的很难追溯。CARE-X所强调的正是"基于测量的工具"这一表述所指的结构——在得出诊断之前,留下可计算的中间数值。这意味着医生不再只是接收判读文本、判断对错,而是可以同时确认心脏宽度、胸廓宽度这样具体的数值以及计算过程。编排器自行判断是否需要调用工具这一点也值得注意。这似乎表明,系统并非对所有图像都强制执行相同的计算,而是将只在必要时才调用测量工具的灵活推理机制内置于系统之中。

医疗AI从单纯生成文本走向留下结构化依据的趋势,并不只体现在CARE-X上。谷歌研究院也于8月11日宣布,为其医疗AI研究系统AMIE增加了实时语音、视频问诊咨询功能,这同样是试图将患者的表情、呼吸等此前仅靠文本对话难以捕捉的非语言信号纳入系统的尝试。尽管方式不同,但这两个案例的共同点在于:AI不再只是给出结果,而是将重点放在如何留下判断过程、使其可被验证。

那么,这意味着什么改变

CARE-X实际精度如何、以何种数据集进行了验证,仅凭此次发布内容尚无法确认。但这一架构所指向的方向是明确的。如果AI在看胸部X光时,能够给出"心脏宽度0.408、胸廓宽度0.752、CTR为0.54"这样的计算过程,而不是仅仅一句"心脏看起来偏大",医护人员就能够对该判断进行重新计算,或依据其他标准重新审视。对于正考虑引入判读辅助AI的医院或研究机构而言,下一步的评估标准很可能不再是"结果"本身,而是其"依据结构"是如何设计的。

评论