Guardoc 用 Amazon Nova 模型革新医疗文档处理,错误率降低 46%
Guardoc Health 利用 Amazon Nova 模型和 Bedrock 平台,将长期护理机构的临床文档处理自动化,实现 46% 的错误率降低和 70% 的审计罚款减少。本文详解其 RAG 管道和 PDF 处理方案,对国内医疗信息化和 AI 文档处理有参考价值。
一句话看懂
Guardoc Health 使用 Amazon Nova 模型在 Bedrock 上构建医疗文档处理管道,将错误率降低 46%,审计罚款减少 70%,单设施年 ROI 超 40 万美元。
详细发生了什么
每天,护士和护理团队依赖的临床文档往往碎片化、不一致且容易出错。Guardoc Health 利用 Amazon Nova 系列模型(通过 Amazon Bedrock 提供)解决这一难题,帮助专业护理机构和辅助生活中心更快、更准确地提取、分类和处理复杂文档。
医疗文档格式五花八门:多页 PDF 含手写注释、复选框决定承保范围的预授权表格、嵌入表格或扫描图像中的药物清单、混合打字字段和手写印章的患者入院表。Guardoc 高峰期每天处理超过 100 万份文档,即使 1% 的错误率也会产生数千条错误记录。
Guardoc 的管道采用 RAG 技术:首先通过 Amazon Textract 提取文本和结构元数据,按临床意义分块,用 Amazon Titan Text Embeddings V2 嵌入并存储在 DynamoDB 中(按患者分区)。检索前用自定义预过滤器缩小候选集,然后通过 k-NN 搜索最相关块。之后用 Amazon Nova 2 Lite 进行文本级粗筛,最后用 Amazon Nova Pro 对原始 PDF 字节进行多模态推理,输出最终分类。每个分类结果都能追溯到原始文档的具体页面。
Amazon Nova Pro 在多模态 PDF 处理上表现出色,包括布局理解、表单结构、复选框状态、签名、手写注释和字段空间关系。
中文圈视角
对国内医疗信息化从业者和 AI 开发者来说,Guardoc 的方案有几点值得关注:
-
技术栈可借鉴:RAG + 多阶段成本分层(轻量模型做粗筛、重量模型做精判)的思路,在国内医疗文档处理场景同样适用。国内可替代方案包括:用阿里云 OCR 或百度 OCR 做文本提取,用 DashScope 上的 Qwen-VL 做多模态推理,用 ModelScope 上的嵌入模型做向量化。
-
合规与数据安全:Guardoc 按患者分区存储嵌入向量,避免跨患者检索,这在国内医疗数据合规(如《个人信息保护法》《健康医疗大数据标准》)中也是关键要求。国内厂商需注意数据不出域、患者授权等细节。
-
成本优化:管道中先做 OCR 和文本嵌入(低成本),再逐步升级到多模态模型(高成本),这种分层策略能显著降低推理总成本。国内公有云(如阿里云、腾讯云)也提供类似的分层模型服务,但需要自行搭建管道。
-
中文文档特殊性:医疗文档中中文手写识别、表格结构解析、专业术语(如 ICD-10 编码)的准确率仍是挑战。国内已有平安健康、科大讯飞等公司在做类似尝试,但公开案例较少。
几条值得记住的细节
- Guardoc 报告文档错误率降低 46%,审计罚款减少 70%,单设施年 ROI 超过 40 万美元。
- 管道使用 Amazon Nova 2 Lite 做粗筛,Amazon Nova Pro 做最终多模态推理,按成本分层。
- 每个分类结果都能追溯到原始 PDF 的具体页面,确保临床可追溯性。
- 高峰期每天处理超过 100 万份文档,系统按患者分区水平扩展。
- Amazon Nova Pro 在多模态 PDF 处理上表现优于纯文本模型,能理解复选框、手写和布局。
一句话总结
Guardoc 展示了如何用分层 RAG 管道和低成本多模态模型,在医疗文档处理中同时实现高精度和高吞吐。