AI 快讯 编译自 aws_ml_blog #功能更新#AWS#推理优化

Amazon SageMaker AI 异步推理新增内联请求负载支持,简化小负载推理流程

AWS 宣布 SageMaker AI 异步推理支持内联负载,可直接在 API 请求体中发送不超过 128KB 的推理数据,无需先上传至 S3。本文详解新功能原理、代码对比、适用场景及对中文开发者的实际影响。

编译发布 2026/06/17 原文发布 2026/06/17

一句话看懂

Amazon SageMaker AI 异步推理现在支持直接在 API 请求中发送不超过 128KB 的负载,省去每次调用前上传 S3 的步骤。

详细发生了什么

AWS 宣布 Amazon SageMaker AI 异步推理(Async Inference)新增内联负载支持。此前,开发者调用异步推理端点必须先将输入数据上传到 S3,再通过 InputLocation 参数传递 S3 URI。现在,对于不超过 128,000 字节(约 128KB)的负载,可以直接通过新的 Body 参数在请求体中发送,省去一次网络往返和 S3 上传操作。

新功能的关键细节:

  • Body 参数接受原始字节,上限 128KB。
  • BodyInputLocation 互斥,同时设置会返回同步错误。
  • 输出行为不变,结果仍写入 S3 OutputLocation
  • 无需修改现有异步端点配置或模型容器。
  • 已在 31 个商业 AWS 区域可用。

中文圈视角

对国内 AWS 用户而言,这个更新直接降低了异步推理的架构复杂度。许多中文开发者使用 SageMaker 处理 NLP 或轻量级结构化数据推理时,小负载(如 JSON 格式的 prompt)占很大比例。此前必须配置 S3 桶、管理 IAM 权限、处理对象清理,现在只需一个 API 调用即可。

不过需要注意:国内使用 AWS 服务仍需合规访问,且该功能目前仅在海外区域上线,中国区域(北京、宁夏)尚未明确支持。对于国内云厂商用户,阿里云 PAI-EAS 和华为云 ModelArts 的异步推理目前仍依赖对象存储(OSS/OBS)中转,暂无类似内联功能,AWS 此更新在易用性上暂时领先。

另外,128KB 的限制意味着它主要适用于文本 prompt、结构化 JSON 等场景,图像、音频等大负载仍需走 S3 上传。中文开发者可借此优化聊天机器人、批量文本生成等场景的推理流水线。

几条值得记住的细节

  • 内联负载上限为 128,000 字节(原始字节),超过此大小必须使用 S3 上传。
  • BodyInputLocation 互斥,同时设置会返回 ValidationError
  • 新功能无需修改现有异步端点或模型容器,仅需更新客户端 SDK。
  • 支持 31 个 AWS 商业区域,包括东京、新加坡、香港等亚太区域。
  • 使用内联负载可节省 S3 PUT 请求费用,并减少 IAM 权限管理负担。

一句话总结

如果你用 SageMaker 异步推理处理小负载,现在可以省去 S3 上传步骤,代码更简洁、延迟更低、成本更少。