AI 快讯 编译自 the_decoder #AI医疗#Nature研究#模型老化

Nature两研究:AI诊断媲美医生,但模型老化问题凸显

《自然》杂志最新研究显示,专用AI系统在模拟病例中诊断和治疗决策能力与医生相当甚至更优。但两项研究均基于已过时的基础模型,引发对AI医疗模型快速迭代与长期可靠性的讨论。

编译发布 2026/06/18 原文发布 2026/06/18

一句话看懂

《自然》两篇论文证实,专用AI在模拟诊疗中不输医生,但所用基础模型已显陈旧,引发对AI医疗长期有效性的担忧。

详细发生了什么

《自然》杂志同日发表两项独立研究,分别测试了AI系统在诊断和制定治疗方案上的表现。第一项研究由斯坦福大学团队完成,他们开发了一个基于LLaMA-2的专用模型,在1000个模拟病例中,诊断准确率达到92%,与资深医生持平,在罕见病识别上甚至高出5个百分点。第二项研究来自英国NHS合作项目,使用基于GPT-3.5的模型处理初级诊疗决策,在治疗建议合理性上获得与全科医生相当的评分。

然而,两项研究均指出,所用基础模型——LLaMA-2(2023年发布)和GPT-3.5(2022年发布)——在论文发表时已被更新版本取代。研究者警告,医疗AI的临床验证周期(通常1-2年)远长于模型迭代速度,这意味着部署时模型可能已过时。

中文圈视角

对国内用户而言,这两项研究有直接参考价值。首先,国内医疗AI创业公司(如推想科技、数坤科技)多使用自研或国产基础模型(如百度文心、阿里通义),同样面临模型快速迭代与临床审批慢的矛盾。目前国内三类医疗器械审批周期约2-3年,而大模型每半年就有重大升级,导致获批产品可能已落后于最新技术。

其次,研究中的模拟病例设计对中文场景有启示:国内疾病谱(如乙肝、胃癌高发)与西方不同,直接套用国外模型需要大量本地化训练数据。目前国内尚无类似规模的公开基准测试。

最后,监管层面,中国已发布《生成式人工智能服务管理暂行办法》,但医疗AI的专门法规仍在制定中。这两项Nature研究提示,监管需考虑模型的“保质期”问题。

几条值得记住的细节

  • 斯坦福模型基于LLaMA-2,在1000个模拟病例中诊断准确率92%,罕见病识别优于医生。
  • NHS项目使用GPT-3.5,治疗建议合理性评分与全科医生无显著差异。
  • 两项研究的基础模型发布时间均超过2年,已非当前最新版本。
  • 研究者建议建立“模型版本锁定+定期更新”的医疗AI验证机制。
  • 国内医疗AI审批周期约2-3年,与模型迭代速度严重不匹配。

一句话总结

AI诊断能力已接近医生,但模型快速过时的问题提醒我们:医疗AI的可靠性需要动态验证,而非一次认证管终身。