AI 快讯 编译自 aws_ml_blog #功能更新#安全#AI Agent

Amazon Bedrock 推出 InvokeGuardrailChecks API,为 AI Agent 提供无资源安全检测

AWS 发布 InvokeGuardrailChecks API,无需创建 Guardrail 资源即可在 AI Agent 多轮交互中按需调用安全检测。支持内容过滤、提示攻击检测、敏感信息识别,返回数值分数,开发者可自定义阈值和动作。对国内 Agent 开发者的安全合规实践有参考意义。

编译发布 2026/06/16 原文发布 2026/06/16

一句话看懂

AWS 发布 InvokeGuardrailChecks API,允许在 AI Agent 的多轮对话中按需调用安全检测,无需预先创建 Guardrail 资源,返回数值分数供开发者自定义阈值和动作。

详细发生了什么

AWS 宣布 Amazon Bedrock Guardrails 推出新 API——InvokeGuardrailChecks。该 API 允许开发者在 AI Agent 工作流的任意环节调用独立的安全检查,而无需事先创建 Guardrail 资源。

传统 AI 应用的安全检查模式是:用户输入→模型响应→Guardrail 统一评估。但 AI Agent 以多轮循环方式工作,每轮都有输入和输出两个检查点,且不同步骤风险不同。例如客服 Agent:用户初始提问(风险:prompt injection)→模型生成计划(风险:输出有害内容)→用户提供账户信息(风险:PII 泄露)→模型最终回复(风险:不当内容)。

InvokeGuardrailChecks API 支持三种安全检测:内容过滤(有害内容,严重度分数 0-1)、提示攻击检测(jailbreak/prompt injection/prompt leakage,严重度分数 0-1)、敏感信息过滤(31 种 PII 实体,置信度分数 0-1)。API 仅返回分数,不阻塞或改写内容,开发者可基于分数自定义阈值和动作(如阻止、重试、记录)。

该 API 的关键特性:无资源(无需预先创建 Guardrail)、仅检测(detect-only)、对称请求-响应(请求中指定的 safeguard 与返回结果一一对应)、独立的提示攻击检测(可从内容过滤中分离出来单独调用)。

中文圈视角

对国内 AI Agent 开发者来说,这个 API 提供了更灵活的安全检测思路。目前国内主流大模型平台(如百度千帆、阿里百炼、智谱开放平台)的安全审核多采用统一接口,缺乏按步骤细粒度控制的能力。InvokeGuardrailChecks 的“无资源”设计特别适合 Agent 场景——Agent 每轮可能调用不同工具,安全需求动态变化,预先创建 Guardrail 资源会带来管理负担。

不过,国内用户需注意:Amazon Bedrock 目前在中国大陆无法直接访问,需通过 AWS 海外区域或使用代理。国内替代方案可参考阿里云百炼的“安全审核”功能或百度千帆的“内容审核”接口,但它们尚未提供类似的无资源、按步骤调用的 API。此外,数据出境合规是敏感点——如果 Agent 处理用户 PII,使用 AWS 海外服务需确保符合《个人信息保护法》要求。

一个值得关注的盲点:国内 Agent 框架(如 Dify、FastGPT)在安全检测方面普遍较弱,开发者往往依赖模型自身的安全对齐,缺乏独立的安全检测层。InvokeGuardrailChecks 的“仅检测”模式允许开发者将安全逻辑与模型调用解耦,这一设计理念值得国内框架借鉴。

几条值得记住的细节

  • API 返回的分数是离散值:{0, 0.2, 0.4, 0.6, 0.8, 1.0},1.0 表示最严重或最确定。
  • 敏感信息检测支持 31 种 PII 实体,包括 email、电话、SSN、信用卡号等。
  • 提示攻击检测可独立调用,无需同时运行内容过滤。
  • 每个检测结果包含 messageIndex、contentIndex 和字符偏移量,便于精确定位问题内容。
  • 使用该 API 需要 IAM 权限 bedrock:InvokeGuardrailChecks,且可限制区域(如 us-east-1)。

一句话总结

对 Agent 开发者而言,InvokeGuardrailChecks 提供了一种更灵活、更细粒度的安全检测方式,无需管理 Guardrail 资源,按需调用即可。