AI 快讯 编译自 simon_willison #模型发布#OpenAI#GPT-5.6

OpenAI 发布 GPT-5.6 三款模型 Luna、Terra、Sol,性能与成本优势显著

OpenAI 推出 GPT-5.6 系列,包括 Luna、Terra、Sol 三款模型,主打长时 agent 任务性能,在 Agents' Last Exam 上超越 Claude Fable 5,且成本更低。本文详解定价、基准测试及对中文用户的实际影响。

编译发布 2026/07/09 原文发布 2026/07/09

一句话看懂

OpenAI 发布 GPT-5.6 三款模型(Luna、Terra、Sol),在长时 agent 任务上超越 Claude Fable 5,且成本更低,但 SWE-Bench Pro 编码测试落后。

详细发生了什么

OpenAI 于 2026 年 7 月 9 日正式发布 GPT-5.6 系列旗舰模型,包含三个尺寸:Luna(最小)、Terra(中等)、Sol(最大)。定价按每百万输入/输出 token 计算:Luna $1/$6,Terra $2.50/$15,Sol $5/$30。作为对比,Claude Opus 系列为 $5/$25,Claude Fable 5 为 $10/$50。但单纯比较 token 价格意义不大,因为不同模型在相同任务上使用的推理 token 数量差异很大。

OpenAI 重点宣传其长时 agent 性能。在 Agents’ Last Exam 基准测试中(评估 55 个领域的长时间专业工作流),GPT-5.6 Sol 以 53.6 分领先 Claude Fable 5(自适应推理)13.1 分。即使在中等推理设置下,Sol 也以约四分之一成本领先 Fable 5 11.4 分。更小的 Terra 和 Luna 模型则以约十六分之一成本超越 Fable 5。

有趣的是,在 SWE-Bench Pro 编码基准上,Fable 5 以 80% 碾压 GPT-5.6 Sol 的 64.6%。OpenAI 前一天专门发文指出该基准约 30% 的任务存在缺陷,建议谨慎解读结果。

中文圈视角

对中文用户而言,GPT-5.6 系列目前仍需通过 OpenAI API 访问,国内直接使用存在网络限制,但可通过合规的 API 代理或 Azure OpenAI 服务间接使用。国产模型如 DeepSeek、Kimi、智谱 GLM 等尚未在长时 agent 任务上达到同等水平,但差距正在缩小。

具体场景影响:

  • 编程:SWE-Bench Pro 表现不如 Claude Fable 5,但 OpenAI 质疑该基准可靠性,实际编码能力需自行测试。
  • 长时任务:如自动化报告生成、多步数据分析,GPT-5.6 的 agent 性能优势明显,适合需要长时间稳定推理的场景。
  • 成本:Luna 和 Terra 的性价比极高,适合预算有限的个人开发者或中小企业。

监管方面:使用 OpenAI 模型需注意数据出境合规,涉及敏感数据时建议选择国内备案的模型或本地部署方案。目前中文圈对 GPT-5.6 的讨论较少,尤其是其 agent 性能的实际落地效果值得关注。

几条值得记住的细节

  • GPT-5.6 三款模型定价:Luna $1/$6,Terra $2.50/$15,Sol $5/$30(每百万 token 输入/输出)。
  • Agents’ Last Exam 上 Sol 得分 53.6,领先 Claude Fable 5 的 40.5 分(自适应推理)。
  • SWE-Bench Pro 上 Fable 5 得分 80%,Sol 仅 64.6%,但 OpenAI 指出该基准约 30% 任务有缺陷。
  • Terra 和 Luna 以约十六分之一成本超越 Fable 5 的 agent 性能。
  • 作者早期体验 Sol 后评价“非常胜任”,但未提供具体细节。

一句话总结

GPT-5.6 系列在长时 agent 任务上性价比突出,但编码能力存疑,中文用户需权衡网络、合规和实际需求。