AI 快讯 编译自 aws_ml_blog #开源工具#Agent 评估#AWS

AWS 开源 Agent-EvalKit:系统化评估 AI Agent 的六阶段框架,集成 Claude Code 等编码助手

AWS 发布开源工具 Agent-EvalKit(Apache 2.0),通过六阶段流程系统化评估 AI Agent 的工具调用、事实准确性等维度。它集成 Claude Code、Kiro CLI 等编码助手,在开发环境中完成从测试生成到代码级改进建议的全流程。本文详解其工作原理,并以旅行研究 Agent 为例展示效果。

编译发布 2026/06/11 原文发布 2026/06/11

一句话看懂

AWS 开源 Agent-EvalKit,通过六阶段流程系统化评估 AI Agent 的工具调用、事实准确性等维度,并直接给出代码级改进建议。

详细发生了什么

团队构建 AI Agent 时,传统输出级测试无法捕捉深层问题:Agent 可能给出结构良好的回答,但实际在工具返回空结果时编造事实;也可能跳过验证步骤却得出正确结论。这些失败隐藏在最终响应之下,需要追踪完整执行路径——调用了哪些工具、返回了什么数据、响应是否忠实反映数据。

Agent-EvalKit 是一个开源工具包(Apache 2.0 许可),通过集成 AI 编码助手(包括 Claude Code、Kiro CLI 和 Kilo Code)来解决这一评估基础设施缺失问题。它将整个评估工作流引入开发环境,而非作为部署后的独立环节。用户用自然语言描述评估目标,工具包自动处理从读取 Agent 源代码、生成针对性测试用例,到运行评估并生成包含代码位置改进建议的报告。

工具包分为六个阶段:Plan(读取代码生成评估计划)、Data(生成测试用例或导入现有数据)、Trace(添加 OpenTelemetry 兼容追踪)、Run Agent(执行测试并生成结构化追踪文件)、Eval(运行指标评估)、Report(分析模式并生成优先级排序的代码级建议)。每个阶段通过斜杠命令(如 /evalkit.plan)调用,支持自然语言指导。

中文圈视角

Agent-EvalKit 对中文开发者的价值在于:它提供了一个不依赖特定云平台的开源评估框架。虽然示例使用了 Amazon Bedrock,但工具本身可适配任何 Agent 框架(如 LangGraph、CrewAI)。国内用户可以在本地或国产云环境(阿里云、华为云)上使用,无需梯子。

与国内同类工具对比:目前中文社区缺乏类似的系统化 Agent 评估工具。智谱、DeepSeek 等厂商主要提供模型本身,Agent 评估多依赖手动测试或简单脚本。Agent-EvalKit 的 OpenTelemetry 追踪和代码级建议能力,对使用 LangChain、Dify 等框架的国内开发者尤其有用。

需要注意的盲点:工具依赖 AI 编码助手(Claude Code 等),国内用户可能需要通过 API 访问。但评估逻辑本身是开源的,可以独立运行或集成到国产编码助手(如通义灵码)中。

几条值得记住的细节

  • 六阶段流程:Plan → Data → Trace → Run Agent → Eval → Report,每个阶段可独立重跑。
  • 支持 Strands、LangGraph、CrewAI 等框架的自动检测与追踪。
  • 评估指标支持 DeepEval 和 Strands Evals SDK,可组合代码评估器和 LLM-as-Judge。
  • 报告中的改进建议直接引用代码文件行号,便于定位问题。
  • 开源许可为 Apache 2.0,可自由商用和修改。

一句话总结

Agent-EvalKit 让 AI Agent 评估从黑盒输出检查变为可追溯、可复现、可改进的系统工程,尤其适合追求 Agent 可靠性的开发者。