AI 快讯 编译自 aws_ml_blog #功能更新#文档处理#AWS

Amazon Bedrock Data Automation 新增蓝图指令优化功能,几分钟提升文档提取准确率

AWS 推出蓝图指令优化功能,通过 3-10 个示例文档自动优化提取指令,无需模型微调即可提升结构化数据提取准确率。本文详解操作步骤、最佳实践及对中文用户的实际意义。

编译发布 2026/06/11 原文发布 2026/06/11

一句话看懂

AWS 为 Bedrock Data Automation 推出蓝图指令优化,用 3-10 个示例文档自动调整提取指令,几分钟内提升准确率,无需手动调优。

详细发生了什么

Amazon Bedrock Data Automation (BDA) 新增蓝图指令优化功能,旨在解决从发票、合同、税表等非结构化文档中提取结构化数据时准确率不足的问题。传统方法需要手动迭代调整字段指令,耗时数周;新功能通过用户提供 3-10 个代表性文档及对应的 ground truth(正确值),自动分析提取结果与真实值的差异,优化每个字段的自然语言指令,整个过程只需几分钟。

优化后指令会变得更具体,例如初始指令 “The invoice number” 可能优化为 “The invoice number, typically found in the upper right corner of the document header, formatted as a numeric or alphanumeric code following ‘Invoice #’ or ‘Invoice No.’”。AWS 给出的示例场景中,采购订单提取的 aggregate exact match 从 90% 提升至 92%,单文件最佳 case 从 92% 提升至 100%。该功能可通过 Bedrock 控制台或 API 使用,无需单独模型微调。

中文圈视角

对中文用户而言,这项功能直接利好处理大量中文文档的企业,如发票识别、合同审查、报关单处理等场景。但需注意:BDA 目前对中文文档的支持程度取决于底层模型能力,且优化指令本身是英文自然语言,中文文档的字段指令可能需要先用英文描述,或依赖模型对中文的理解。国内替代方案如百度智能文档分析、阿里云文档智能等也提供类似结构化提取能力,但缺乏这种自动指令优化机制。

另外,数据安全是中文用户必须考虑的:使用 BDA 意味着文档数据需上传至 AWS 海外区域(或中国区域,但功能可能受限),涉及敏感数据时需评估合规性。对于无法出海的场景,可关注国内云厂商是否跟进类似功能。

几条值得记住的细节

  • 需要提供 3-10 个代表性文档及对应的 ground truth JSON 文件,覆盖文档多样性以避免过拟合。
  • 优化后只修改字段的 instruction 值,type 和 inferenceType 保持不变。
  • 优化指标包括 F1 分数和 exact match rate,示例中 aggregate exact match 从 90% 提升至 92%。
  • 可通过 Bedrock 控制台或 API 触发优化,AWS 还提供了 CloudFormation 模板快速部署示例。
  • 该功能无需单独模型微调,直接利用 BDA 内置模型能力。

一句话总结

如果你在用 Bedrock Data Automation 处理文档提取,蓝图指令优化能帮你省掉数周手动调优时间,但中文场景需先验证模型对中文的支持程度。