GPT-5.6 Sol 综合基准测试仅差 Fable 5 一分,成本仅三分之一
OpenAI 最新模型 GPT-5.6 Sol 在 Artificial Analysis Intelligence Index 上获得 59 分,仅比 Claude Fable 5 低 1 分,但每次任务成本仅 $1.04,是 Anthropic 旗舰模型的三分之一。在 agentic coding 任务中,Sol 击败所有竞争对手,给 Anthropic 带来更大定价压力。
一句话看懂
OpenAI 的 GPT-5.6 Sol 在综合基准测试中仅比 Claude Fable 5 低 1 分,但成本只有后者的三分之一,并在 agentic coding 上全面领先。
详细发生了什么
根据 Artificial Analysis Intelligence Index 的最新数据,OpenAI 的 GPT-5.6 Sol 获得了 59 分,仅比 Anthropic 的 Claude Fable 5 低 1 分。更引人注目的是,Sol 每次任务成本仅为 $1.04,而 Fable 5 的成本约为 $3.12,这意味着 Sol 在性能接近的情况下,成本只有 Fable 5 的三分之一。
在 agentic coding 这一关键领域,Sol 的表现甚至超越了所有竞争对手,包括 Fable 5。这给 Anthropic 带来了巨大的定价压力,因为 OpenAI 正在以更低的价格提供几乎同等的性能。
中文圈视角
对于中文用户来说,GPT-5.6 Sol 的发布意味着几个关键点:
-
价格优势对国内用户同样重要:虽然 OpenAI 的 API 在国内直接使用需要梯子,但许多开发者通过海外服务器或代理调用。$1.04 每次任务的成本,相比 Claude Fable 5 的 $3.12,能显著降低开发成本,尤其适合高频调用的 agent 应用。
-
国产模型的竞争压力:目前国内头部模型如 DeepSeek-V3、Kimi 等,在综合性能上仍落后于 GPT-5.6 Sol 和 Fable 5。Sol 的性价比优势可能迫使国内厂商进一步降价或加速迭代。例如,DeepSeek 的 API 定价约为 $0.5 每百万 token,但 agentic coding 能力尚不及 Sol。
-
agentic coding 场景的落地机会:Sol 在 agentic coding 上的领先,意味着使用 OpenAI 模型构建自动化编程助手的成本更低、效果更好。国内开发者可以借此开发更强大的代码生成工具,但需注意数据出境合规问题。
-
监管盲点:目前国内对 AI 模型的监管主要关注内容安全,而 agentic coding 这类技术能力差异尚未被充分讨论。Sol 的 agent 能力可能引发对自动化编程安全性的新思考。
几条值得记住的细节
- GPT-5.6 Sol 在 Artificial Analysis Intelligence Index 上得分为 59,Claude Fable 5 为 60。
- Sol 每次任务成本 $1.04,Fable 5 约 $3.12,成本仅为三分之一。
- 在 agentic coding 基准测试中,Sol 击败了所有其他模型,包括 Fable 5。
- 该指数综合了多个基准测试,包括推理、编码、数学等能力。
- 定价压力可能促使 Anthropic 调整 Fable 5 的价格或推出更便宜的版本。
一句话总结
GPT-5.6 Sol 以更低成本提供了接近顶级的性能,尤其在 agentic coding 上领先,给 Anthropic 带来定价压力,也为开发者提供了更经济的选择。