AI 快讯 编译自 aws_ml_blog #AI Agent#评估框架#AWS

AWS 与 Motorway 联合发布 AI Agent 生产级评估方案:错误率从 1/8 降至 1/50

Motorway 与 AWS 合作构建了一套端到端 AI Agent 评估流水线,将错误率从 1/8 降至 1/50,问题检测时间从数小时缩短至数分钟。本文详解其三层评估框架、五阶段部署门禁及开源工具 strands-agents-evals,为中文开发者提供可落地的 Agent 生产化参考。

编译发布 2026/07/23 原文发布 2026/07/23

一句话看懂

Motorway 与 AWS 联合发布了一套基于 Strands Agents SDK 和 Amazon Bedrock AgentCore 的 AI Agent 评估流水线,将错误率从 1/8 降至 1/50,问题检测时间从数小时缩短至数分钟。

详细发生了什么

英国在线汽车拍卖平台 Motorway 每天有 8000 家经销商竞拍 2500 辆车。他们与 AWS PACE 团队合作,构建了一个基于 Strands Agents SDK 和 Amazon Bedrock AgentCore 的经销商库存搜索 Agent,支持自然语言查询,取代了传统的手动 CSV 筛选。

但 Agent 的可靠性是关键挑战:工具选择错误导致搜索结果偏差,语义搜索误解返回无关结果,多轮对话中的上下文漂移丢失用户意图。为此,双方设计了一套端到端评估流水线,包含:

  • 两阶段评估策略:开发阶段使用 strands-agents-evals 进行构建时测试,生产阶段使用 Amazon Bedrock AgentCore Evaluations 进行监控。
  • 三层评估框架:工具使用(>95% 通过率)、推理(>85%)、输出质量(>90%)。
  • 五阶段部署流水线:每个阶段设置质量门禁,指标低于阈值时阻止发布。

该方案已开源,提供可部署的蓝图,核心原则与云平台无关。

中文圈视角

这套方案对国内 AI Agent 开发者有几点直接参考价值:

  1. 三层评估框架可复用:工具使用、推理、输出质量的分层评估思路,不依赖 AWS 特定服务,可直接迁移到阿里云、腾讯云或自建环境。国内 Agent 框架如 Dify、FastGPT、Coze 目前缺乏类似的系统化评估方案,开发者可借鉴此框架自行搭建。

  2. Strands Agents SDK 与国产 Agent 框架对比:Strands 强调可观测性和评估原生集成,类似国内 Agent 框架的“可观测性”模块,但更深入。国产框架如 Dify 的日志和评估功能相对基础,此方案提供了更细粒度的工具调用轨迹验证和 LLM-as-judge 评分,值得参考。

  3. 生产级门禁机制:国内很多 Agent 项目停留在 demo 阶段,缺乏部署前的质量门禁。五阶段流水线(开发→CI/CD→预发布→金丝雀→生产)的思路,可直接用于阿里云 SAE、腾讯云 Serverless 等 CI/CD 流程中。

  4. 合规与安全:方案强调最小权限 IAM、API Key 存储在 Parameter Store、类型参数防注入,这些安全实践对国内金融、汽车等行业的 Agent 落地尤为重要。

几条值得记住的细节

  • Motorway Agent 暴露了 8 个工具,涵盖 89 个车辆属性,结合 LanceDB 向量搜索和 Amazon Titan Text Embeddings V2。
  • 峰值并发用户约 1500,工具选择错误或语义误解会直接影响用户信任。
  • 评估流水线使用三种评分器:代码确定性评分(Layer 1)、LLM-as-judge(Layer 2/3)、自定义评分器(数据新鲜度、经销商范围、安全护栏)。
  • 部署蓝图基于 AWS CDK v2、Python 3.14+,初始部署约 30-45 分钟,定制需 2-3 小时。
  • 运行示例评估套件费用约 $5-10,生产监控费用取决于采样率。

一句话总结

AI Agent 从 demo 到生产的关键在于系统化评估——这套方案给出了可复用的三层框架和门禁机制,中文开发者可直接借鉴。