AI 快讯 编译自 the_decoder #模型发布#基准测试#争议

OpenAI 称 GPT-5.6 Sol 在 ARC-AGI-3 上超越 Opus 5,但测试设置引发争议

OpenAI 声称其 GPT-5.6 Sol 模型在 ARC-AGI-3 基准测试中得分 38.3%,超过 Anthropic 的 Opus 5。但该成绩使用了 OpenAI 自有 API 和额外设置,而非官方测试环境,引发公平性争议。了解测试细节、争议焦点及对中文用户的影响。

编译发布 2026/07/30 原文发布 2026/07/30

一句话看懂

OpenAI 称 GPT-5.6 Sol 在 ARC-AGI-3 上以 38.3% 得分超越 Anthropic Opus 5,但测试条件存在争议,官方环境仅得 7.8%。

详细发生了什么

OpenAI 宣布其最新模型 GPT-5.6 Sol 在 ARC-AGI-3 基准测试中取得了 38.3% 的得分,声称超过了 Anthropic 此前创下的纪录。ARC-AGI-3 是衡量模型抽象推理能力的测试,被视为 AGI 的重要指标。

然而,OpenAI 的成绩并非在官方标准测试环境下获得。他们使用了最新的 API 功能以及两个额外设置(具体细节未完全公开),而在官方提供的标准测试环境中,GPT-5.6 Sol 的得分仅为 7.8%。

ARC Prize 组织回应称,其测试环境是提供商中立的,但可能使用了过时的 API 版本,这可能导致与 Opus 5 的比较出现偏差。Anthropic 的 Opus 5 此前在官方测试中取得了更高分数,但具体数字未在本文中提及。

这一争议凸显了 AI 基准测试中标准化的重要性,以及不同 API 版本和设置对结果的巨大影响。

中文圈视角

对于中文用户,这一事件有几点值得关注:

  1. 基准测试的可信度:国内 AI 社区常引用 ARC、MMLU 等基准来比较模型性能。此次争议提醒我们,测试条件(API 版本、额外设置)对结果影响极大。国内模型如 DeepSeek、Kimi 在类似测试中是否也面临同样问题?用户应关注测试细节而非仅看分数。

  2. API 生态差异:OpenAI 通过自有 API 优化性能,而国内用户若想复现结果,需使用相同 API 版本和设置。目前国内访问 OpenAI API 需梯子,且成本较高。国内模型如智谱 GLM-4、百度文心一言在类似推理任务上的表现如何?缺乏直接对比。

  3. 监管与合规:如果 OpenAI 模型在特定 API 设置下表现更优,但国内用户无法使用这些设置(或因合规限制无法访问最新 API),则实际体验可能远低于宣传。中文用户应关注模型在本地化环境下的真实表现。

  4. 盲点:ARC-AGI-3 测试本身是否适合中文场景?该测试基于英文视觉推理,中文模型在中文推理任务上可能另有优势。国内尚未有类似争议的公开讨论。

几条值得记住的细节

  • GPT-5.6 Sol 在官方 ARC-AGI-3 测试中得分 7.8%,在 OpenAI 自有 API 和额外设置下得分 38.3%。
  • ARC Prize 组织表示其测试环境提供商中立,但可能使用了过时的 API。
  • OpenAI 声称超越 Anthropic Opus 5,但未公布 Opus 5 的具体官方分数。
  • 额外设置的具体内容未完全公开,引发公平性质疑。
  • 该事件凸显了 AI 基准测试标准化的重要性。

一句话总结

GPT-5.6 Sol 的 ARC-AGI-3 成绩存在争议,中文用户应谨慎看待基准测试分数,关注实际可用性。