AI 快讯 编译自 aws_ml_blog #金融合规#数据脱敏#AWS

亨廷顿银行用AWS从4亿文档中自动识别并删除敏感数据,处理时间从数年缩短至数月

亨廷顿银行利用Amazon Textract、SageMaker、Step Functions等AWS服务,构建可扩展的文档处理流水线,从4亿+文档中检测并删除PII和PCI数据,准确率超95%,成本仅为原估算的5%。本文详解技术架构与规模化挑战。

编译发布 2026/06/24 原文发布 2026/06/24

一句话看懂

亨廷顿银行用AWS云服务构建自动化流水线,从4亿+历史文档中检测并删除敏感数据,处理时间从数年缩短至数月,准确率超95%。

详细发生了什么

亨廷顿国家银行(美国前十大银行)的文档管理系统自2015年起存储了数亿份文档,包含大量客户敏感信息(如社保号、账户号)和PCI数据。2025年,作为主动合规计划的一部分,银行需要系统性地处理这些文档并删除敏感数据。

原估算需要数年才能完成。通过设计基于Amazon Textract(OCR服务)、Amazon SageMaker、AWS Step Functions和AWS Lambda的可扩展工作流,银行将处理时间缩短到几个月。核心要求包括:数据加密(传输和存储)、严格访问控制、PCI DSS合规、输出回传本地存储、脱敏准确率≥95%。

数据迁移使用AWS DataSync和Direct Connect,将4亿+文档加密传输至S3。检测阶段,Amazon Textract提取文档中的文本、表格和表单,输出JSON格式的检测字段及坐标。Step Functions编排流程,利用map state分布式模式实现高并发,每天处理约1000万份文档。通过CloudWatch监控请求速率和节流情况,动态调整并发以保持在服务配额内。

脱敏阶段,使用PyMuPDF或PIL等开源库对检测到的敏感字段进行图像级遮盖。Step Functions提供错误处理和重试逻辑,确保大规模处理可靠性。最终,脱敏后的文档通过AWS DataSync回传至本地存储。

项目成果:处理整个文档库的成本仅为原估算的5%,脱敏准确率超过95%,满足合规要求。亨廷顿计划将该框架用于并购等高容量脱敏场景。

中文圈视角

这个案例对国内金融行业有直接参考价值。国内银行同样面临海量历史文档(如开户资料、交易凭证)的合规处理需求,尤其是《个人信息保护法》和《数据安全法》实施后,对敏感数据脱敏的要求日益严格。

国内云厂商(如阿里云、腾讯云、华为云)均有类似OCR和文档处理服务,例如阿里云OCR、腾讯云慧眼、华为云OCR,但缺乏像Amazon Textract这样直接集成脱敏功能的端到端方案。国内银行通常需要自行组合多个服务,或使用第三方厂商(如合合信息、来也科技)的文档处理平台。

一个关键差异:国内银行对数据出境有严格限制,必须使用本地化部署或国内云服务。AWS在中国区(宁夏、北京)提供部分服务,但功能完整性和可用性可能滞后于全球区域。此外,国内银行更倾向于私有化部署,而本案例完全基于公有云,这在国内大型银行中仍存在合规和信任障碍。

另一个盲点:国内银行在处理中文文档时,OCR对中文、混合排版(如表格、手写体)的识别准确率是核心挑战。Amazon Textract对中文支持有限,国内厂商在中文OCR上更有优势。

几条值得记住的细节

  • 处理规模:4亿+文档,每天处理约1000万份,从数年缩短至数月。
  • 成本:总处理成本仅为原估算的5%。
  • 脱敏准确率:超过95%,满足合规要求。
  • 核心服务:Amazon Textract(OCR检测)、AWS Step Functions(编排与并发控制)、AWS DataSync(数据迁移与回传)。
  • 并发控制:利用Step Functions map state分布式模式,配合CloudWatch监控节流,动态调整并发。

一句话总结

亨廷顿银行用AWS云服务证明了大规模文档脱敏可以又快又省,为金融行业合规处理海量历史数据提供了可复用的技术蓝图。