OpenAI GPT-5.6 Sol发布,编程基准超越Claude Mythos 5,但美国政府限制访问引发争议
OpenAI最新旗舰模型GPT-5.6 Sol在编程基准测试中击败Anthropic的Claude Mythos 5,但美国政府强制实施受限部署。OpenAI公开批评该政策不可持续,引发AI监管与创新平衡的讨论。
一句话看懂
OpenAI发布GPT-5.6 Sol,编程能力超越Claude Mythos 5,但美国政府强制限制其访问范围,OpenAI称此政策不可持续。
详细发生了什么
OpenAI于2026年6月26日发布了最新旗舰模型GPT-5.6 Sol。该模型在多项编程基准测试中超越了Anthropic的Claude Mythos 5。然而,根据美国政府的AI安全法规,GPT-5.6 Sol的部署受到严格限制:仅能通过政府控制的API访问,使用场景需预先审批。OpenAI在公告中明确表示,这种“政府控制访问”模式在经济和运营上不可持续,可能阻碍AI技术的健康发展。
GPT-5.6 Sol在HumanEval和SWE-bench等基准上得分分别比Claude Mythos 5高12%和8%,但在推理和创意写作任务上双方互有胜负。OpenAI强调,Sol的架构引入了新的稀疏注意力机制,使其在长上下文任务中效率提升30%。
中文圈视角
对于中国用户,GPT-5.6 Sol目前无法直接使用——不仅因为美国政府限制,还因为OpenAI API在中国大陆未开放。但这一事件对国内AI行业有重要启示:
-
国产替代机会:DeepSeek、Kimi等国产模型在编程能力上已接近GPT-4水平,但距离GPT-5.6 Sol仍有差距。美国政府的限制可能倒逼国内加速自主研发,尤其是在稀疏注意力等前沿架构上。
-
监管模式对比:中国对AI模型的监管同样严格,但采取的是“备案制”而非“政府控制访问”。OpenAI的抱怨提示,过度限制可能抑制创新。国内用户可关注ModelScope等平台上的开源模型,它们不受此类出口管制。
-
中文场景影响:GPT-5.6 Sol的多语言能力尚未公布,但若未来开放,中文写作和编程辅助将受益。目前,国内用户可尝试Claude(需海外手机号)或国产模型作为平替。
几条值得记住的细节
- GPT-5.6 Sol在HumanEval上得分92.3%,Claude Mythos 5为82.1%。
- 模型采用稀疏注意力机制,长上下文处理效率提升30%。
- 美国政府限制仅允许通过联邦AI安全委员会控制的API访问。
- OpenAI称该政策每年增加数亿美元合规成本,不可持续。
- 模型定价尚未公布,但预计高于GPT-4 Turbo的$0.01/1K token。
一句话总结
GPT-5.6 Sol性能领先但被政策束缚,提醒我们AI发展不仅靠技术,还需平衡监管与创新。