PRISM2模型:Paige与微软合作,用临床对话解读病理切片,提升癌症检测准确率
Paige和微软联合推出PRISM2病理AI模型,通过临床对话训练解读全切片图像,在泛癌检测中AUC达0.967。本文解析其架构、性能及对中文医疗AI的启示。
一句话看懂
Paige与微软联合发布PRISM2病理AI模型,用临床对话训练解读全切片图像,泛癌检测AUC达0.967,超越现有基础模型。
详细发生了什么
PRISM2是Paige和微软合作开发的病理学AI模型,核心创新在于用临床对话来解读病理切片,而不是简单的像素分类。模型采用perceiver-based编码器,联合组织切片和病理报告中的临床对话进行训练,将每张切片的数千个tile embeddings聚合为一个表征,然后生成文本回答诊断问题。
训练数据涵盖230万张全切片图像,对话监督来自纪念斯隆凯特琳癌症中心(MSK)在常规诊疗中收集的685,507份病理报告,这些报告由GPT-4o转换为问答对。架构分两个阶段:第一阶段训练切片编码器,聚合tile特征为slide-level向量;第二阶段冻结编码器,只微调语言模型(Phi-3 Mini,40亿参数)学习病理报告规范。
性能上,PRISM2在前列腺癌和乳腺癌检测中达到或超过临床级产品水平,在乳腺癌淋巴结分类中无需额外训练即超越Paige BLN。泛癌检测中,诊断嵌入AUC达0.967,优于基础嵌入的0.956,以及PRISM的0.947和TITAN的0.931。生存分析中,PRISM2嵌入在结直肠癌复发-free生存任务上一致性指数达0.809,优于从零训练的专业模型(0.773)。
模型权重已在Hugging Face发布,但训练和推理流程依赖Paige和微软的专有基础设施,外部团队难以完全复现。
中文圈视角
对中文医疗AI领域,PRISM2的发布有几个值得关注的要点。首先,国内病理AI创业公司如推想医疗、深睿医疗等,目前多依赖传统监督学习,PRISM2的对话式训练思路可能启发新的技术路线。其次,模型权重公开,但训练数据来自单一机构(MSK),国内团队若直接使用,需注意扫描仪差异和人群差异,建议在本地数据上验证嵌入迁移效果。
从合规角度看,病理数据涉及患者隐私,国内使用此类模型需遵循《数据安全法》和《个人信息保护法》,数据出境需审批。此外,PRISM2的对话生成能力可能受限于单轮对话,实际临床交互需进一步开发。中文病理报告与英文差异大,直接迁移效果存疑,但可借鉴其方法论,用中文报告构建类似训练集。
目前中文圈对此模型讨论较少,建议关注其后续在外部验证中的表现,以及Paige是否推出中文版。
几条值得记住的细节
- 训练数据:230万张全切片图像,685,507份病理报告,覆盖200,692名患者。
- 对话生成:GPT-4o将报告转为问答对,数据集比PRISM子集大3.5倍,约一半性能提升归因于此。
- 错误率:病理医生审查发现,诊断摘要错误率8%,是非题错误率18%,模型自身问答错误率7%-11%。
- 架构限制:无位置编码,无法推理结构空间关系;所有扫描固定分辨率0.5微米/像素。
- 嵌入类型:基础嵌入适合生物标志物预测,诊断嵌入针对癌症检测和亚型分类,生存任务需单独微调。
一句话总结
PRISM2展示了临床对话训练在病理AI中的潜力,但国内应用需考虑数据合规和本地化适配。