Amazon Bedrock 推出 InvokeGuardrailChecks API,为 AI Agent 提供无资源安全检测
AWS 发布 InvokeGuardrailChecks API,无需创建 Guardrail 资源即可在 AI Agent 多轮交互中按需调用安全检测。支持内容过滤、提示攻击检测、敏感信息识别,返回数值分数,开发者可自定义阈值和动作。对国内 Agent 开发者的安全合规实践有参考意义。
一句话看懂
AWS 发布 InvokeGuardrailChecks API,允许在 AI Agent 的多轮对话中按需调用安全检测,无需预先创建 Guardrail 资源,返回数值分数供开发者自定义阈值和动作。
详细发生了什么
AWS 宣布 Amazon Bedrock Guardrails 推出新 API——InvokeGuardrailChecks。该 API 允许开发者在 AI Agent 工作流的任意环节调用独立的安全检查,而无需事先创建 Guardrail 资源。
传统 AI 应用的安全检查模式是:用户输入→模型响应→Guardrail 统一评估。但 AI Agent 以多轮循环方式工作,每轮都有输入和输出两个检查点,且不同步骤风险不同。例如客服 Agent:用户初始提问(风险:prompt injection)→模型生成计划(风险:输出有害内容)→用户提供账户信息(风险:PII 泄露)→模型最终回复(风险:不当内容)。
InvokeGuardrailChecks API 支持三种安全检测:内容过滤(有害内容,严重度分数 0-1)、提示攻击检测(jailbreak/prompt injection/prompt leakage,严重度分数 0-1)、敏感信息过滤(31 种 PII 实体,置信度分数 0-1)。API 仅返回分数,不阻塞或改写内容,开发者可基于分数自定义阈值和动作(如阻止、重试、记录)。
该 API 的关键特性:无资源(无需预先创建 Guardrail)、仅检测(detect-only)、对称请求-响应(请求中指定的 safeguard 与返回结果一一对应)、独立的提示攻击检测(可从内容过滤中分离出来单独调用)。
中文圈视角
对国内 AI Agent 开发者来说,这个 API 提供了更灵活的安全检测思路。目前国内主流大模型平台(如百度千帆、阿里百炼、智谱开放平台)的安全审核多采用统一接口,缺乏按步骤细粒度控制的能力。InvokeGuardrailChecks 的“无资源”设计特别适合 Agent 场景——Agent 每轮可能调用不同工具,安全需求动态变化,预先创建 Guardrail 资源会带来管理负担。
不过,国内用户需注意:Amazon Bedrock 目前在中国大陆无法直接访问,需通过 AWS 海外区域或使用代理。国内替代方案可参考阿里云百炼的“安全审核”功能或百度千帆的“内容审核”接口,但它们尚未提供类似的无资源、按步骤调用的 API。此外,数据出境合规是敏感点——如果 Agent 处理用户 PII,使用 AWS 海外服务需确保符合《个人信息保护法》要求。
一个值得关注的盲点:国内 Agent 框架(如 Dify、FastGPT)在安全检测方面普遍较弱,开发者往往依赖模型自身的安全对齐,缺乏独立的安全检测层。InvokeGuardrailChecks 的“仅检测”模式允许开发者将安全逻辑与模型调用解耦,这一设计理念值得国内框架借鉴。
几条值得记住的细节
- API 返回的分数是离散值:{0, 0.2, 0.4, 0.6, 0.8, 1.0},1.0 表示最严重或最确定。
- 敏感信息检测支持 31 种 PII 实体,包括 email、电话、SSN、信用卡号等。
- 提示攻击检测可独立调用,无需同时运行内容过滤。
- 每个检测结果包含 messageIndex、contentIndex 和字符偏移量,便于精确定位问题内容。
- 使用该 API 需要 IAM 权限 bedrock:InvokeGuardrailChecks,且可限制区域(如 us-east-1)。
一句话总结
对 Agent 开发者而言,InvokeGuardrailChecks 提供了一种更灵活、更细粒度的安全检测方式,无需管理 Guardrail 资源,按需调用即可。