Nature两研究:AI诊断媲美医生,但模型老化问题凸显
《自然》杂志最新研究显示,专用AI系统在模拟病例中诊断和治疗决策能力与医生相当甚至更优。但两项研究均基于已过时的基础模型,引发对AI医疗模型快速迭代与长期可靠性的讨论。
一句话看懂
《自然》两篇论文证实,专用AI在模拟诊疗中不输医生,但所用基础模型已显陈旧,引发对AI医疗长期有效性的担忧。
详细发生了什么
《自然》杂志同日发表两项独立研究,分别测试了AI系统在诊断和制定治疗方案上的表现。第一项研究由斯坦福大学团队完成,他们开发了一个基于LLaMA-2的专用模型,在1000个模拟病例中,诊断准确率达到92%,与资深医生持平,在罕见病识别上甚至高出5个百分点。第二项研究来自英国NHS合作项目,使用基于GPT-3.5的模型处理初级诊疗决策,在治疗建议合理性上获得与全科医生相当的评分。
然而,两项研究均指出,所用基础模型——LLaMA-2(2023年发布)和GPT-3.5(2022年发布)——在论文发表时已被更新版本取代。研究者警告,医疗AI的临床验证周期(通常1-2年)远长于模型迭代速度,这意味着部署时模型可能已过时。
中文圈视角
对国内用户而言,这两项研究有直接参考价值。首先,国内医疗AI创业公司(如推想科技、数坤科技)多使用自研或国产基础模型(如百度文心、阿里通义),同样面临模型快速迭代与临床审批慢的矛盾。目前国内三类医疗器械审批周期约2-3年,而大模型每半年就有重大升级,导致获批产品可能已落后于最新技术。
其次,研究中的模拟病例设计对中文场景有启示:国内疾病谱(如乙肝、胃癌高发)与西方不同,直接套用国外模型需要大量本地化训练数据。目前国内尚无类似规模的公开基准测试。
最后,监管层面,中国已发布《生成式人工智能服务管理暂行办法》,但医疗AI的专门法规仍在制定中。这两项Nature研究提示,监管需考虑模型的“保质期”问题。
几条值得记住的细节
- 斯坦福模型基于LLaMA-2,在1000个模拟病例中诊断准确率92%,罕见病识别优于医生。
- NHS项目使用GPT-3.5,治疗建议合理性评分与全科医生无显著差异。
- 两项研究的基础模型发布时间均超过2年,已非当前最新版本。
- 研究者建议建立“模型版本锁定+定期更新”的医疗AI验证机制。
- 国内医疗AI审批周期约2-3年,与模型迭代速度严重不匹配。
一句话总结
AI诊断能力已接近医生,但模型快速过时的问题提醒我们:医疗AI的可靠性需要动态验证,而非一次认证管终身。