每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

谷歌为医疗AI"AMIE"新增视频·语音问诊能力

原本停留在文本对话的AMIE扩展至实时视频问诊,在模拟诊疗中展现出专家级表现

여성이 손동작을 하며 노트북 속 AI 수어 번역과 소통한다

이미지: Google

摘要

  • 谷歌研究院(Google Research)升级了其医疗AI研究系统AMIE,使其能够进行实时音视频问诊咨询。
  • 这被介绍为在采用随机对照试验形式的模拟问诊中,首次展现出专家级表现的案例。
  • 研究重点在于让系统能够读取患者的表情、呼吸、动作等非语言信号。
Advancing AMIE Towards Expert-Level Video Consultations
시스템
AMIE(Articulate Medical Intelligence Explorer) — 구글 리서치의 의료 AI 연구 시스템
발표일
2026년 8월 11일, Google Research 블로그
확장 범위
텍스트 기반 대화 → 실시간 음성·영상(오디오-비주얼) 진료 상담
시험 규모
임상 시나리오 100개(5개 신체 계통) · 환자 배우 15명 · 표준화 상담 300건
시스템 구조
Talker·Planner·Perception 3개 에이전트 병렬 — Gemini·Project Astra 기반
핵심 결과
진단 정확도 등은 1차 진료의와 동급, 신체 징후 끌어내기·공감 평가는 상회

隔着屏幕问诊的AI

"能把手腕对着摄像头给我看看吗?"如果视频问诊画面中问出这句话的不是医生而是AI呢?在患者转动手腕的同时,系统会观察其动作和表情,并决定接下来要确认什么。谷歌研究院于8月11日公布的医疗AI研究系统AMIE(Articulate Medical Intelligence Explorer)新版本,做的正是这件事。原本停留在文本聊天阶段的AMIE,如今扩展为实时语音视频问诊咨询,并在涵盖100个临床场景、15名训练有素的患者演员、300次标准化问诊的测试中得到了验证。研究团队将此称为"首次在视频问诊中展现专家级表现的演示"。

测试是这样设计的

研究团队设计了涵盖心肺、腹部、耳鼻喉及头颈、神经精神、肌肉骨骼这五大身体系统的100个临床场景。15名训练有素的患者演员按照场景进行表演,共完成了300次标准化问诊,问诊分为三组进行比较:视频版AMIE、文本版AMIE,以及使用相同视频界面问诊的10名初级保健医生。谁表现更好,则由未参与问诊的20名经验丰富的初级保健医生组成的独立评审小组进行评估。这一设计模仿了随机对照试验(RCT)方式,其特点在于让系统比拼的是整个诊疗过程,而非医疗AI研究中常见的"解题式基准测试"。

系统内部由三个专业智能体异步并行运作构成。负责与患者实时对话的Talker、承担临床推理的Planner、从画面和语音中读取临床信号的Perception各自运转,同时交换信息。这相当于用角色分工的方式,模拟人类医生在问诊过程中同时说话、思考、观察的能力。其底层技术基于Gemini和实时多模态技术项目Project Astra。

结果——哪些持平,哪些领先

评估维度结果
病史采集·诊断准确性·管理计划·沟通能力与初级保健医生持平
引导患者展示体征·指导虚拟体格检查超过医生和文本版AMIE
患者演员对使用便利性·效果的偏好超过医生和文本版AMIE
共情·融洽关系·诊疗信任感评价超过医生和文本版AMIE

值得关注的是领先领域的性质。隔着屏幕引导患者展示体征、指导患者完成检查动作,这本是文本时代的AMIE根本无法做到的领域,而恰恰是在这个领域,它获得了高于人类医生的评价。患者演员在共情和信任方面也给AI打出更高分数,这一现象自文本版AMIE研究时期起就反复出现。

这意味着什么

主导该研究的高级研究员Anil Palepu和研究主管Mike Schaekermann解释道:"诊疗远不止于交谈的内容。"在实际诊室中,医生会观察患者的步态、脸上流露出的疼痛痕迹、呼吸的节律,并亲自引导患者完成体格检查动作。仅靠文本对话完全无法捕捉这些非语言信号,这一直是此前的局限所在。

从技术角度看,这是难度截然不同的问题。文本诊断对话只需一次交换一句话即可,但视频问诊要求在聆听患者讲话的同时观看画面,并在这个过程中持续进行推理。这意味着,此前仅凭语言模型推理能力一较高下的医疗AI,正在迈入实时整合表情、动作、语音语调等多模态信号的阶段。这也与谷歌近期在学术工具(PaperVizAgent、ScholarPeer)或气候模型评估(AIMIP)等研究基础设施方面全面扩展的趋势相呼应。

谷歌公开两款AI智能体:绘制论文图表并进行审稿

那么会带来什么改变

视频问诊已成为远程医疗的标准形式。AMIE恰恰在这一形式中——即便只是在模拟层面——展现出专家级性能,这意味着一个新的试金石已经出现:判断它能否超越文本聊天机器人,真正进入实际临床工作流程。但局限性也很明显。此次结果是由专业患者演员表演完成的模拟测试,因此覆盖范围仅限于能够通过表演呈现的病症,系统中也观察到间歇性的识别、推理错误及技术问题。针对真实患者的临床验证尚未开展。能够在屏幕中指导检查动作的AI,如今已走到了实验室的门槛前,而打开下一扇门的钥匙,将是针对真实患者的验证。