OpenAI 预览 GPT-5.6 系列:Sol、Terra、Luna 三层模型,新增 max 和 ultra 推理模式
OpenAI 发布 GPT-5.6 模型家族预览,分为 Sol、Terra、Luna 三个层级,引入 max 和 ultra 两种新推理模式。Sol 在 Terminal-Bench 2.1 上达到 91.91% 准确率,Terra 性能持平 GPT-5.5 但成本减半,Luna 为低价快速选项。本文解读模型细节、定价及对中文用户的影响。
一句话看懂
OpenAI 推出 GPT-5.6 三层模型家族,Sol 旗舰、Terra 性价比、Luna 低价快响应,新增 max 和 ultra 推理模式,目前仅限约 20 个合作伙伴预览。
详细发生了什么
OpenAI 开始有限预览 GPT-5.6 系列,这是其下一代模型家族。与以往不同,GPT-5.6 不再是一个单一模型,而是分为三个命名层级:Sol(旗舰)、Terra(日常生产)、Luna(快速低成本)。每个层级可以独立更新,开发者可根据智能、速度和成本选择。
Sol 是 OpenAI 目前最强的模型,在编码、生物学和网络安全方面有显著提升。Terra 性能与 GPT-5.5 相当,但成本约降低一半。Luna 以最低价格提供强大能力。
GPT-5.6 新增两种推理控制模式:max 和 ultra。max 模式让 Sol 有更多时间进行深度推理;ultra 模式则利用子代理(subagents)并行处理复杂任务,加速完成。两者均以延迟和成本换取准确性。
在 Terminal-Bench 2.1 基准测试中,Sol(ultra 模式)达到 91.91% 准确率,Sol(max 模式)88.76%,超过 Claude Mythos 5 的 88% 和 GPT-5.5 的 83.4%。在 Agent’s Last Exam 中,Sol 是唯一超过 50% 的模型(代码模式 50.9%)。在 GeneBench v1 和 ExploitBench 上,Sol 也表现出色,且 token 消耗更少。
定价方面(每百万 token):Sol 输入 $5、输出 $30;Terra 输入 $2.50、输出 $15;Luna 输入 $1、输出 $6。缓存写入成本为 1.25 倍未缓存输入,缓存读取保持 90% 折扣,支持显式缓存断点和 30 分钟最小缓存寿命。OpenAI 计划在 7 月让 Sol 在 Cerebras 硬件上运行,目标达到 750 tokens/秒。
中文圈视角
GPT-5.6 的三层模型策略对中文用户有直接参考价值。目前国内大模型(如 DeepSeek、Kimi、智谱 GLM)多采用单一模型或简单分层,OpenAI 的 Sol/Terra/Luna 分层方式更精细,为不同场景提供明确选择。
对于中文开发者,Terra 层性价比突出($2.50/$15),适合高并发生产任务,如客服摘要、文档处理。Luna 层($1/$6)适合实时应用,如自动补全、邮件分类。但需要注意的是,GPT-5.6 目前仅通过 API 和 Codex 对约 20 个合作伙伴开放,中文用户需等待更广泛可用性,且可能需要梯子。
国内替代方面,GLM-5.2 等开源模型在定价上更具优势,但 Terminal-Bench 等基准测试显示 Sol 在复杂工具协调任务上领先。中文用户应关注 Terra 和 Luna 的性价比,以及 max/ultra 推理模式在长链任务(如代码生成、数据分析)中的实际效果。
监管层面,OpenAI 已与美国政府共享模型和计划,安全堆栈更重。中文用户使用 API 时需注意数据出境合规,尤其是涉及敏感信息。
几条值得记住的细节
- Sol 在 Terminal-Bench 2.1 上 ultra 模式达 91.91%,max 模式 88.76%,均超过 Claude Mythos 5 的 88%。
- Terra 性能与 GPT-5.5 持平,但成本减半($2.50/$15 vs GPT-5.5 的 $5/$30)。
- Luna 定价最低($1/$6),适合快速、常规、低成本任务。
- 新增 max(深度推理)和 ultra(子代理并行)两种推理模式,可 trade-off 延迟和成本。
- 缓存支持显式断点和 30 分钟最小缓存寿命,写入成本 1.25x,读取折扣 90%。
一句话总结
GPT-5.6 的三层模型和推理模式为不同需求提供精准选择,中文用户可重点关注 Terra 的性价比和 Luna 的低延迟,但需等待广泛开放并注意合规。