AI 快讯 编译自 aws_ml_blog #AWS#限流#AI网关

AWS AgentCore 网关新增限流功能,精细控制 AI 流量保护下游模型

AWS 宣布 AgentCore 网关支持限流,可按用户或目标设置请求、token 和连接限制,保护下游模型和工具免受流量冲击。本文详解配置方法、维度键和示例,并分析对中文开发者的影响。

编译发布 2026/08/06 原文发布 2026/08/06

一句话看懂

AWS 为 AgentCore 网关推出限流功能,可按用户或目标设置请求、token 和连接限制,防止流量尖峰压垮下游 AI 服务。

详细发生了什么

Amazon Bedrock AgentCore 网关是一个全托管的 serverless AI 网关,为 AI 流量提供统一安全入口,可路由到托管搜索、知识库、MCP 服务器、推理模型(LLM)、代理(A2A、工具代理)或 HTTP 端点。今天,AWS 宣布支持限流,让用户能精细控制每个用户通过网关的流量消耗。

限流支持三种目标类型:MCP 目标、推理目标和 HTTP 透传目标。主要指标包括:

  • 请求速率限制(RPS/RPM):适用于所有目标类型,每个请求计为一个单位,无论耗时长短。
  • Token 速率限制(TPM):仅适用于推理目标,计入输入和输出 token。网关使用通用 tokenizer 预估并预扣,响应后根据实际用量调整。
  • 连接速率限制(CPS):适用于所有目标类型,跟踪每个请求占用连接的时间,适合限制长连接并发。

限流配置由维度键(dimension keys)和条目(entries)组成。维度键定义如何分组流量,支持 targetName、toolName、qualifiedModelId、JWT 声明(如 $.context.jwt.<claim>)、IAM principal 和 sourceIdentity。条目定义每个桶的吞吐量,支持通配符 * 为每个不同值创建独立桶,命名条目优先于通配符。

示例中,三个用户组(Basic、Advanced、Beta)通过 JWT 角色声明区分,每个组对每个目标有独立限流。客户自定义限流优先于服务配额(Service Quotas),后者是 AWS 账户级上限。

中文圈视角

对中文开发者来说,AgentCore 网关的限流功能有几个关键点:

  1. 可用性:AgentCore 是 AWS 托管服务,国内用户需通过 AWS 中国区或海外区访问,可能需要考虑网络延迟和合规问题。如果使用 AWS 中国区,需确认该功能是否同步上线。

  2. 平替对比:国内云厂商如阿里云、腾讯云也有 API 网关,但针对 AI 流量的限流(如 token 级)较少见。如果使用国产模型(如通义千问、DeepSeek),可能需要自行实现类似逻辑,或等待国内云服务跟进。

  3. 实际场景:对于部署了多个模型或工具的企业,限流能防止单个用户过度消耗资源,确保关键业务稳定。中文用户常使用流式输出(如聊天机器人),连接速率限制(CPS)对这类长连接场景很有价值。

  4. 盲点:很多人关注模型能力,但忽略了网关层的流量治理。限流是生产环境稳定性的关键,中文技术社区对此讨论较少,值得关注。

几条值得记住的细节

  • 请求速率限制适用于所有目标类型,每个请求计为一个单位,无论耗时 50ms 还是 90 秒。
  • Token 限制仅适用于推理目标,预扣后根据实际用量调整,确保准确。
  • 连接限制(CPS)跟踪连接占用时长,适合限制流式调用的并发数。
  • 维度键支持 JWT 声明(如 $.context.jwt.role),可按用户组设置不同限流。
  • 命名条目优先于通配符,例如 Booking 目标可单独设 100 RPS,其他目标默认 10 RPS。

一句话总结

AgentCore 网关限流让 AI 流量管理更精细,中文用户可借鉴其思路,用类似方法保护自建模型服务。