OpenAI GPT-5.6 三款模型登陆 Amazon Bedrock,显式提示缓存可降低 90% 推理成本
OpenAI GPT-5.6 Sol、Terra、Luna 已在 Amazon Bedrock 上正式可用,并支持显式提示缓存,可精确控制缓存内容,缓存读取成本降低 90%。本文介绍如何上手、设置缓存及迁移现有工作负载。
一句话看懂
OpenAI GPT-5.6 三款模型(Sol/Terra/Luna)在 Amazon Bedrock 上线,新增显式提示缓存,缓存读取成本打一折,适合代理工作流等重复提示场景。
详细发生了什么
OpenAI 与 AWS 联合宣布,GPT-5.6 系列模型(Sol、Terra、Luna)已在 Amazon Bedrock 上正式可用。三款模型覆盖不同能力层级:Sol 面向复杂推理与智能体编码,Terra 适合日常生产负载,Luna 专为分类、摘要等高吞吐任务设计。
新模型通过 Amazon Bedrock 的 bedrock-mantle 端点提供服务,使用 OpenAI 兼容的 Responses API。认证方式推荐使用 AWS 凭证生成的短期 bearer token,无需长期密钥。模型支持 reasoning effort 级别(none/low/medium/high/xhigh),且 GPT-5.6 比前代更节省 token,可在更低 effort 下保持质量。
最值得关注的新功能是显式提示缓存(explicit prompt caching):开发者可以手动标记提示中的稳定前缀(如系统指令、工具定义、参考文档),这些内容会被缓存并在后续请求中复用。缓存读取按 90% 折扣计费,缓存写入按 1.25 倍计费,缓存有效期为 30 分钟。对于代理工作流这类重复提示场景,显式缓存比默认的隐式缓存命中率更高。
此外,模型支持 function calling、结构化输出(strict JSON schema)以及流式响应,与 OpenAI 原生 API 完全兼容。
中文圈视角
对国内用户来说,这条消息有几个关键点:
-
可用性与门槛:GPT-5.6 通过 Amazon Bedrock 提供,国内用户需要能够访问 AWS 服务(通常需要国际网络环境)。相比直接调用 OpenAI API,Bedrock 的优势在于可以计入 AWS 承诺消费、享受 AWS 的安全与治理控制。对于已经在使用 AWS 的企业,这是一个更合规、更易管理的入口。
-
国产平替对比:国内类似服务如阿里云百炼、百度千帆、华为云 ModelArts 等也提供多模型托管,但尚未见到如此细粒度的显式缓存控制。显式缓存对于高频调用场景(如客服机器人、代码助手)能显著降低成本,国内平台如果跟进,将利好开发者。
-
对中文场景的影响:GPT-5.6 的中文能力预计延续 OpenAI 一贯水平,但通过 Bedrock 使用可能面临更高的延迟(服务器在海外)。对于实时性要求高的应用,国产模型(如 DeepSeek、Qwen)在延迟和成本上仍有优势。
-
监管合规:通过 AWS 使用 OpenAI 模型,数据会出境,需符合《数据安全法》和《个人信息保护法》要求。企业应评估数据脱敏和合规方案。
几条值得记住的细节
- 模型 ID:openai.gpt-5.6-sol、openai.gpt-5.6-terra、openai.gpt-5.6-luna。Sol 仅在美国东部(弗吉尼亚、俄亥俄)可用,Terra 和 Luna 额外支持美国西部(俄勒冈)。
- 缓存折扣:缓存读取按 90% 折扣计费,缓存写入按 1.25 倍计费,缓存有效期 30 分钟。
- 隐式缓存默认开启:无需修改代码即可享受缓存,但显式缓存命中率更高,适合代理工作流。
- 推理 effort 建议:从 GPT-5.5/5.4 升级时,先保持原 effort 级别,再尝试降低一级,GPT-5.6 更 token 高效。
- 认证方式:使用 aws-bedrock-token-generator 生成短期 token,避免长期密钥泄露风险。
一句话总结
如果你在用 AWS 且需要高频调用 OpenAI 模型,GPT-5.6 的显式缓存能大幅降低推理成本,值得立即试用。