Google 测试 AMIE 视频问诊,AI 医生表现与真人相当
Google 的医学 AI 系统 AMIE 在视频问诊测试中,临床评估得分与初级保健医生相当。本文解析其多智能体架构、测试方法及局限,并探讨对中文医疗 AI 领域的启示。
一句话看懂
Google 的医学 AI 系统 AMIE 在视频问诊测试中,临床评估得分与真人医生相当,但距离实际临床应用仍需真实患者研究。
详细发生了什么
Google 的研究医学 AI 系统 AMIE(视频版)与专业患者演员进行了同步视频问诊。在多项核心指标上,临床评估者的评分与初级保健医生(PCP)相当。15 名训练有素的演员分别模拟了心肺、腹部、HEENT(头眼耳鼻喉)、神经或精神、肌肉骨骼等五类病症。
AMIE 采用异步多智能体架构,而非单一模型处理所有任务。它分为三个智能体:对话智能体负责与患者互动,维持对话流畅;规划智能体在后台更新鉴别诊断和管理计划,识别缺失信息;感知智能体持续分析视频和音频,捕捉非语言信号和身体发现。这种设计解决了单一智能体无法同时兼顾对话响应速度和深度推理的问题。
研究采用多臂随机对照设计,比较了视频版 AMIE、文本版 AMIE 和 10 名认证初级保健医生。20 名经验丰富的医生独立评审所有问诊。结果显示,AMIE 在病史采集、诊断准确性、管理适当性和沟通质量方面与医生相当,视频版在引导虚拟检查方面优于医生和文本版。患者演员也更偏好视频界面,认为其更易用、更有效。
中文圈视角
Google 的 AMIE 研究对中文医疗 AI 领域有重要参考价值。目前国内医疗 AI 多聚焦于影像识别或文本问诊,如腾讯觅影、科大讯飞医疗等,但视频问诊 AI 仍属空白。AMIE 的多智能体架构为处理实时视频交互提供了新思路,国内团队可借鉴其“对话-规划-感知”分离的设计,避免单一模型延迟问题。
然而,落地中文场景面临特殊挑战:中文方言和口音多样性、医疗数据出境合规、以及患者对 AI 医生的信任度。国内企业需在数据本地化前提下,开发符合中文医疗习惯的 AI 问诊系统。此外,AMIE 目前仅限研究阶段,国内类似产品也需警惕过度宣传,确保临床验证充分。
几条值得记住的细节
- AMIE 使用三个智能体:对话、规划、感知,异步协作降低延迟。
- 测试涵盖 5 大身体系统,15 名演员参与,评估由 20 名独立医生完成。
- 视频版在引导虚拟检查方面优于真人医生和文本版。
- 患者演员更偏好视频界面,认为其更易用、更有效。
- Google 已与 Beth Israel Deaconess 医学中心开展文本版 AMIE 的真实患者研究。
一句话总结
AMIE 视频问诊测试证明 AI 可媲美真人医生,但真实应用仍需谨慎验证,中文医疗 AI 可借鉴其架构。