OpenAI称GPT-5.6 Sol在定制测试中超越Anthropic Opus 5,ARC-AGI-3得分38.3%
OpenAI声称其GPT-5.6 Sol模型在ARC-AGI-3基准测试中得分38.3%,超越Anthropic Opus 5的30.2%,但该成绩仅在其自定义API环境下实现,官方测试中仅得7.8%。本文解析争议细节及对中文用户的影响。
一句话看懂
OpenAI声称GPT-5.6 Sol在ARC-AGI-3基准测试中得分38.3%,超越Anthropic Opus 5的30.2%,但该成绩仅在其自定义API环境下实现,官方测试中仅得7.8%。
详细发生了什么
OpenAI宣布,其最新模型GPT-5.6 Sol在ARC-AGI-3基准测试中取得38.3%的得分,超过了Anthropic Opus 5此前创下的30.2%纪录。ARC-AGI-3是一个评估模型抽象推理能力的测试集,被视为衡量通用人工智能进展的重要指标。
然而,这一成绩存在重大争议:OpenAI使用的是自己的定制测试环境,通过保留模型的推理链(reasoning chain)和上下文压缩(context compaction)技术来提升性能。而在标准的官方测试环境中,GPT-5.6 Sol的得分仅为7.8%。相比之下,Anthropic Opus 5的30.2%是在没有额外辅助手段的情况下取得的。
OpenAI解释称,其定制测试环境更贴近实际应用场景,但批评者认为这种比较不公平,因为其他模型并未获得同样的优化条件。ARC-AGI-3的创建者François Chollet也对此表示质疑,强调基准测试应保持一致的评估标准。
中文圈视角
这一事件对中文AI社区有几点启示:
-
基准测试的信任危机:国内用户经常依赖ARC、MMLU等基准来比较模型能力,但OpenAI的做法表明,模型厂商可以通过定制测试环境“刷分”。中文用户在选择模型时,应更关注第三方独立评测,例如SuperCLUE、C-Eval等国内基准,而非厂商自报的成绩。
-
国产模型的平替机会:如果OpenAI和Anthropic在标准测试中表现不佳,国产模型如DeepSeek、Kimi、智谱GLM等可能在某些推理任务上具有竞争力。目前DeepSeek-R1在推理链透明性上已有优势,中文用户可关注其在类似ARC任务上的表现。
-
API生态差异:OpenAI的定制环境依赖其API的特定功能(如保留推理链),而国内用户使用OpenAI API需考虑网络访问和成本问题。对于需要高推理能力的场景,可尝试国产模型或本地部署的开源模型(如Qwen2.5)。
-
监管合规:国内对AI模型的安全评估有严格规定,厂商自报成绩可能不被认可。用户应参考国家网信办等机构的官方评测结果。
几条值得记住的细节
- GPT-5.6 Sol在OpenAI定制API环境下ARC-AGI-3得分38.3%,官方标准环境仅7.8%。
- Anthropic Opus 5在标准环境下得分30.2%,未使用任何辅助手段。
- OpenAI的定制环境保留了模型的完整推理链,并应用了上下文压缩技术。
- ARC-AGI-3创建者François Chollet对OpenAI的测试方法表示质疑。
- 该争议凸显了AI基准测试标准化的重要性。
一句话总结
OpenAI的ARC-AGI-3高分依赖定制环境,提醒中文用户不要轻信厂商自报成绩,应关注独立评测。