AI 快讯 编译自 aws_ml_blog #模型蒸馏#命名实体识别#Amazon Bedrock

亚马逊 Bedrock 模型蒸馏实战:IBS Software 构建中英双语货运物流 NER 系统,准确率 95% 成本降 14 倍

IBS Software 利用 Amazon Bedrock 的模型蒸馏能力,将 Nova Pro 知识迁移至 Nova Lite,构建中英双语命名实体识别系统,处理货运邮件,F1 达 95.085%,成本降低 14 倍。本文详解技术方案、挑战与部署架构,对中文用户构建类似系统有参考价值。

编译发布 2026/06/30 原文发布 2026/06/30

一句话看懂

IBS Software 用 Amazon Bedrock 的模型蒸馏,将 Nova Pro 的知识压缩到 Nova Lite,实现中英双语货运 NER,准确率 95%,成本仅为原来的 1/14。

详细发生了什么

IBS Software 的货运系统每天处理数千封中英双语货运物流邮件,需要提取 23 种实体类型,包括空运提单号、航班信息、重量、尺寸、商品描述、发货人/收货人信息等。最初尝试基于 PyTorch 和 TextBrewer 的开源蒸馏方案,但因配置复杂、缺乏托管基础设施、难以调参等问题失败。

团队转向 Amazon Bedrock 的托管蒸馏能力,以 Nova Pro 为教师模型、Nova Lite 为学生模型,使用 token-level KL 散度损失函数,训练 4 个 epoch(70 步),损失从 0.05 降至 0.008。最终蒸馏后的 Nova Lite 在测试集上达到 95.085% 的 F1 分数(英文 96.535%,日文 93.635%),保留了教师模型 98% 的性能,同时推理成本降低 14 倍。

整个项目耗时约 4 个月:第 1 个月准备 500 封标注邮件(350 英文、150 日文),第 2 个月尝试开源方案失败,第 3 个月用 Bedrock 蒸馏成功,第 4 个月生产部署。部署架构基于 S3、Lambda、Bedrock 和 DynamoDB,实现 .eml 文件的实时处理流水线。

中文圈视角

对于中文开发者,这个案例有几点直接参考价值:

  1. 中文 NER 的类似挑战:中文同样面临无空格分词、复杂字符组合(如商品描述中的生僻字)等问题,与日文场景高度相似。IBS 的 token-level 蒸馏方法可直接迁移到中文物流、电商、海关等领域的 NER 任务。

  2. 国产平替考量:目前国内类似托管蒸馏服务较少,但可以通过 ModelScope 上的开源模型(如 Qwen2.5、DeepSeek)自行搭建蒸馏流程,或使用阿里云百炼、百度千帆等平台的模型微调功能。不过这些平台是否提供类似 Bedrock 的“一键蒸馏”托管能力仍需验证。

  3. 成本敏感场景:14 倍成本降低对中文企业极具吸引力。如果每天处理数万封邮件,使用 Nova Lite 级别的模型(或国产轻量模型如 Qwen2.5-1.5B)可以大幅降低推理成本,同时保持高精度。

  4. 数据标注的启示:500 封标注邮件(350 英文 + 150 日文)即达到 95% F1,说明高质量小样本数据配合蒸馏可以高效落地。中文用户可借鉴其标注策略,优先覆盖高频实体类型。

几条值得记住的细节

  • 蒸馏配置:教师模型 Nova Pro,学生模型 Nova Lite,最大序列长度 2048,训练 4 个 epoch 共 70 步。
  • 损失函数使用 token-level KL 散度,损失从 0.05 降至 0.008。
  • 日文 F1(93.635%)比英文(96.535%)低约 3 个百分点,主要因日文训练数据少(150 vs 350)和复杂汉字组合。
  • 生产部署采用 S3 + Lambda + Bedrock + DynamoDB 架构,处理 .eml 文件,输出结构化 JSON。
  • 团队 9 人,4 个月完成从数据准备到生产部署。

一句话总结

如果你需要构建中英双语 NER 系统,Amazon Bedrock 的模型蒸馏可以帮你用低成本获得接近顶尖模型的精度。