OpenAI 发现热门 AI 编程测试 SWE-Bench Pro 约 30% 任务存在缺陷,撤回此前认可
OpenAI 审查了广泛使用的 AI 编程能力测试 SWE-Bench Pro,发现约 30% 的任务存在缺陷,并撤回此前对该基准的认可。这一发现引发对 AI 编程评测可靠性的讨论,对国内模型评测标准制定有参考意义。
一句话看懂
OpenAI 审查发现,流行的 AI 编程能力测试 SWE-Bench Pro 中约 30% 的任务存在缺陷,公司已撤回对该基准的公开认可。
详细发生了什么
OpenAI 对 SWE-Bench Pro 进行了内部审查。这是一个广泛用于衡量 AI 模型编程能力的基准测试。审查结果显示,该测试中大约 30% 的任务存在“broken”问题——任务设计有误、答案不准确或无法正确反映模型的实际编程能力。作为回应,OpenAI 已撤回此前对 SWE-Bench Pro 的公开认可,并建议社区谨慎使用该基准进行模型比较。
SWE-Bench Pro 是 SWE-Bench 的升级版,专门用于评估 AI 模型解决真实世界软件工程任务的能力,包括代码修复、功能实现等。此前,OpenAI 曾引用该基准来展示其模型(如 GPT-4)的编程性能。此次发现意味着,许多基于该基准的排名和结论可能不可靠。
中文圈视角
对中文 AI 社区来说,这一事件有几点值得关注:
-
国产模型评测的警示:国内常用的编程评测基准(如 CodeXGLUE、HumanEval 的中文版)同样可能存在类似问题。模型开发者应主动审查测试集质量,避免“刷榜”现象误导用户。
-
评测标准化的机会:OpenAI 的发现表明,当前 AI 编程评测缺乏统一的质量控制。国内机构(如智源研究院、上海 AI 实验室)可借此推动更严谨的评测标准,建立中文场景下的高质量基准。
-
对用户的实际影响:如果你依赖模型排名选择编程助手(如 GitHub Copilot、通义灵码),需意识到排名可能失真。建议通过实际任务测试模型,而非盲目相信基准分数。
-
监管合规角度:国内 AI 评测若存在缺陷,可能导致模型能力被高估,进而影响金融、医疗等高风险领域的应用安全。监管机构应关注评测数据的可靠性。
几条值得记住的细节
- OpenAI 发现 SWE-Bench Pro 中约 30% 的任务存在缺陷,已撤回对该基准的认可。
- SWE-Bench Pro 用于评估 AI 模型解决真实软件工程任务的能力,包括代码修复和功能实现。
- 此前 OpenAI 曾使用该基准宣传其模型性能,此次发现可能影响历史排名。
- OpenAI 未公开具体哪些任务有问题,但建议社区谨慎使用该基准。
- 该事件引发对 AI 编程评测整体可靠性的讨论,类似问题可能存在于其他基准。
一句话总结
别盲目相信 AI 编程测试排名,OpenAI 发现热门基准 SWE-Bench Pro 三成任务有缺陷,选模型还得靠实际任务验证。