AI 快讯
编译自 the_decoder #AI安全#医疗AI#基准测试
AI读X光片自信满满却错误频出:RadLE 2.0基准测试揭示风险,人类放射科医生仍不可替代
RadLE 2.0基准测试评估AI在放射影像诊断中何时应交给人类。结果显示,许多AI模型在错误时仍高度自信,人类放射科医生准确率远超AI。对中文医疗AI应用有重要警示。
一句话看懂
RadLE 2.0基准测试发现,AI聊天机器人在阅读X光片时,即使诊断错误也常常表现出极高自信,人类放射科医生目前仍远胜AI。
详细发生了什么
RadLE 2.0是一个专门测试放射学AI模型“自知之明”的基准。它要求AI在不确定时主动放弃诊断,交给人类专家。然而,测试结果显示,许多主流AI模型在给出错误结论时,依然保持高置信度,缺乏对自身局限性的认知。
例如,某些模型将正常胸片误判为肺炎,却标注“95%置信”。这种“自信的错误”在临床环境中极其危险,可能导致误诊或延误治疗。相比之下,人类放射科医生在不确定时会主动寻求会诊或进一步检查。
该基准由多家研究机构联合开发,旨在推动AI在医疗影像领域的安全部署。研究强调,AI在独立诊断前,必须先学会“何时闭嘴”。
中文圈视角
这一发现对中文医疗AI市场有直接警示。国内已有多个AI影像辅助诊断产品获批,如推想科技、依图医疗等,但它们的核心模式仍是“辅助”而非“自主诊断”。RadLE 2.0的结果提醒:即便在辅助场景,AI的过度自信也可能误导医生。
目前中文圈讨论多集中在AI提升效率,较少关注“错误模式”。实际上,国内医疗AI面临类似问题——训练数据以西方人群为主,对亚洲人种特征识别可能更差,自信度却未必降低。此外,国内监管对AI诊断的容错率极低,任何“自信错误”都可能引发法律风险。
对于中文用户,这意味着:使用任何AI影像工具时,必须保留人类复核环节,不能盲目信任AI的置信度分数。国产AI在“不确定性表达”能力上仍需加强。
几条值得记住的细节
- RadLE 2.0专门测试AI何时应放弃诊断交给人类,而非单纯准确率。
- 多个主流AI模型在错误时仍标注“95%置信”,存在严重安全隐患。
- 人类放射科医生在不确定时会主动寻求会诊,AI缺乏这种机制。
- 该基准由多家研究机构联合开发,旨在推动AI安全部署。
- 研究强调AI独立诊断前必须先学会“何时闭嘴”。
一句话总结
AI读片能力再强,不懂“认怂”就危险——医疗AI必须先学会说“我不知道”。