OpenAI 发布 GPT-5.6 三档模型家族:Sol/Terra/Luna,新增 Programmatic Tool Calling
OpenAI 于 2026 年 7 月 9 日正式发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三个档次,定价 $1-$5/百万 token。旗舰 Sol 在编码智能指数上超越 Claude Fable 5,并引入 Programmatic Tool Calling 功能,可在隔离 V8 运行时执行模型生成的 JavaScript,大幅减少 token 消耗。本文详解性…
一句话看懂
OpenAI 正式发布 GPT-5.6 三档模型(Sol/Terra/Luna),旗舰 Sol 编码能力超越 Claude Fable 5,新增 Programmatic Tool Calling 功能,可大幅降低 token 消耗。
详细发生了什么
2026 年 7 月 9 日,OpenAI 将 GPT-5.6 系列从预览转为正式可用。这次发布的不再是一个模型,而是三个档次:Sol(旗舰)、Terra(均衡)、Luna(经济)。定价按每百万 token 计算:Sol 输入 $5、输出 $30;Terra 输入 $2.50、输出 $15;Luna 输入 $1、输出 $6。
性能方面,Sol 在 Artificial Analysis Coding Agent Index v1.1 上得分 80,比 Claude Fable 5 高 2.8 分,且输出 token 和耗时均不到后者一半。在 OSWorld 2.0 上,Sol 达到 62.6%,超越 Claude Opus 4.8 的同时输出 token 减少 85%。Sol Ultra 模式(四智能体并行)在 Terminal-Bench 2.1 上达到 91.9%,BrowseComp 上 92.2%。
对开发者最重要的更新是 Programmatic Tool Calling:模型在 Responses API 中生成 JavaScript 代码,在隔离的 V8 运行时执行,无需将每个中间结果返回给模型。Clio 报告提示 token 减少 38%,PlayCo 总 token 减少 63.5%。此外,prompt caching 也得到改进,支持显式缓存断点和 30 分钟最小缓存寿命,缓存写入按 1.25 倍非缓存输入费率计费,缓存读取仍享 90% 折扣。
不过,GPT-5.6 并非在所有领域领先。SWE-Bench Pro 上 Sol 仅 64.6%,落后 Claude Mythos 5 的 80.3% 约 15 分。在 Artificial Analysis Intelligence Index v4.1 上,Fable 5 以 59.9 领先 Sol 的 58.9。Toolathlon 上 Sol 得分 58%,低于 Fable 5 的 61.7%。
中文圈视角
对中文用户来说,GPT-5.6 的 Programmatic Tool Calling 是最大亮点。它允许模型自主编排工具调用,减少往返延迟,非常适合构建复杂工作流(如自动化数据分析、多步骤 API 调用)。但需要注意的是,该功能目前仅在 Responses API 中可用,且需要直接访问 OpenAI API,国内用户需自行解决网络问题。
与国产模型对比:DeepSeek 和 Kimi 在长上下文和中文理解上仍有优势,且无需梯子、价格更低。但在编码智能和工具调用方面,GPT-5.6 Sol 的 80 分编码指数和 Programmatic Tool Calling 的架构创新,目前国产模型尚未完全对标。对于需要前沿编码能力或复杂工具编排的开发者,GPT-5.6 仍是首选,但成本较高(Sol 输出 $30/百万 token)。
另外,OpenAI 的 prompt caching 改进对高频 API 调用用户友好,但缓存写入加价 25% 可能增加成本。中文用户若使用 API,建议结合缓存策略优化预算。
几条值得记住的细节
- 定价:Sol $5/$30 每百万 token,Terra $2.50/$15,Luna $1/$6。
- 编码性能:Sol 在 Coding Agent Index 上 80 分,比 Fable 5 高 2.8 分,token 和耗时减半。
- Programmatic Tool Calling:模型在隔离 V8 运行时执行 JavaScript,Clio 报告提示 token 减少 38%。
- Ultra 模式:四智能体并行,Terminal-Bench 2.1 达 91.9%,但 token 消耗更高。
- 短板:SWE-Bench Pro 落后 Mythos 5 约 15 分;Toolathlon 落后 Fable 5。
一句话总结
GPT-5.6 三档模型在编码和工具调用上大幅进步,但中文用户需权衡网络成本和国产平替的性价比。