AI 快讯 编译自 aws_ml_blog #AI Agent#故障检测#根因分析#Strands Evals#AWS

Strands Evals 新工具:AI Agent 故障自动检测与根因分析,诊断时间从小时缩短到分钟

AWS 发布 Strands Evals SDK 的 Detectors 功能,可自动识别 AI Agent 执行轨迹中的故障并进行根因分析,输出分类故障、因果链和修复建议。本文详解其工作原理、代码示例及对中文开发者的实用价值。

编译发布 2026/06/15 原文发布 2026/06/15

一句话看懂

AWS 推出 Strands Evals 的 Detectors 功能,自动诊断 AI Agent 执行失败的原因,输出分类故障、因果链和修复建议,将诊断时间从数小时缩短到几分钟。

详细发生了什么

传统 AI Agent 评估只能告诉你“目标完成率 60%”,但无法解释为什么失败。AWS 博客介绍了 Strands Evals SDK 中的 Detectors 功能,它通过两阶段分析自动诊断 Agent 执行轨迹:

  1. 故障检测:扫描每个 span(执行步骤),对照九大类故障分类(幻觉、错误动作、编排错误、任务指令不遵守、执行错误、上下文处理错误、重复行为、LLM 输出问题、配置不匹配),返回故障位置、类别、置信度和证据。

  2. 根因分析:将检测到的故障连接成因果链,区分根本原因和下游症状,并给出修复建议(修改系统提示词还是工具定义)。

示例中,一个药物研究助手因工具配置错误导致参数缺失,进而产生幻觉,最终完全偏离目标。Detectors 一次性识别出这三个层次的故障,并给出因果关联。

Detectors 支持三种规模的处理策略:直接分析(适合小会话)、故障路径剪枝(中等会话)、分块合并(超大会话)。

中文圈视角

对中文开发者来说,这个工具直接解决了 Agent 调试的痛点。目前国内 Agent 框架(如百度千帆、阿里百炼)在可观测性和自动诊断方面还比较初级,大多依赖手动查看日志。Strands Evals 的 Detectors 提供了标准化方案,但需要注意:

  • 依赖 Amazon Bedrock:LLM 分析需要 Bedrock 模型访问权限,国内用户可能需要通过 AWS 中国区域或自建类似方案。
  • 国产平替思路:如果无法使用 AWS,可以考虑使用 Langfuse、Phoenix(Arize)等开源可观测性工具,配合本地 LLM(如 DeepSeek、Qwen)实现类似功能,但需要自行构建故障分类和因果分析逻辑。
  • 中文场景适配:故障分类中的“幻觉”检测对中文 Agent 同样有效,但证据提取可能受限于中文 token 化效果。建议在中文 Agent 上测试时关注分类准确率。

目前中文社区对此类 Agent 诊断工具讨论较少,多数团队仍处于“手动看 trace”阶段。Strands Evals 的自动化思路值得借鉴,尤其是因果链和修复建议的生成,能显著降低调试门槛。

几条值得记住的细节

  • Detectors 输出结构化结果:故障类别、置信度(0-1)、证据文本、因果链(PRIMARY/SECONDARY/TERTIARY)、修复建议(system prompt / tool description / other)。
  • 支持三种会话规模策略:直接分析、故障路径剪枝、分块合并,最大可处理超长轨迹。
  • 可与 Strands Evals 评估框架集成,在每次测试运行中自动诊断,形成“评估-诊断-修复”闭环。
  • 需要 Python 3.10+,安装 pip install strands-agents-evals,并配置 Amazon Bedrock 模型访问。
  • 示例中一个 Agent 因工具参数缺失,导致幻觉和完全偏离目标,Detectors 一次性识别三个故障并给出因果关联。

一句话总结

如果你在开发或运维 AI Agent,Strands Evals Detectors 能帮你从“知道它失败了”进化到“知道为什么失败并知道怎么修”。