AI 快讯 编译自 the_decoder #模型评测#代码生成#基准测试

MirrorCode基准测试:AI模型连续编程19天耗资2600美元,Claude Opus 4.7领先

Epoch AI推出MirrorCode基准测试,评估AI模型在不接触原始代码的情况下重建完整程序的能力。Claude Opus 4.7以56%的解决率领先,14小时重建16000行工具包,但所有模型在最复杂任务上仍失败。了解对中文开发者的意义。

编译发布 2026/06/26 原文发布 2026/06/26

一句话看懂

Epoch AI发布MirrorCode基准测试,要求AI模型仅凭描述重建完整程序,Claude Opus 4.7以56%解决率领先,但最复杂任务无一成功。

详细发生了什么

Epoch AI推出了名为MirrorCode的新基准测试,旨在评估AI模型能否在不访问原始代码的情况下,仅根据任务描述重建完整的软件程序。测试包含一系列编程挑战,从简单的函数到复杂的多文件项目。

结果显示,Anthropic的Claude Opus 4.7表现最佳,解决率达56%,并在14小时内成功重建了一个包含16,000行代码的工具包。相比之下,其他模型如GPT-5和Gemini Ultra 2的解决率分别为48%和42%。

然而,所有模型在最复杂的任务上均告失败。其中一个任务要求重建一个大型开源项目,一个模型连续运行了19天,消耗了$2,600的计算成本,仍未完成。这表明当前AI在理解整体架构和长期规划方面仍有显著局限。

MirrorCode的设计理念是模拟真实世界的逆向工程场景——开发者经常需要理解并复现没有文档的遗留代码。Epoch AI计划将基准测试开源,以推动该领域的研究。

中文圈视角

对中文开发者而言,MirrorCode基准测试直接关系到日常工作中的代码复用和重构场景。目前国内主流模型如DeepSeek-Coder、Qwen2.5-Coder在类似任务上的表现尚未公开,但考虑到它们在HumanEval等标准测试中的成绩,预计与GPT-5水平相当。

一个关键差异是成本:$2,600运行19天的案例凸显了复杂代码生成的高昂开销。国内用户使用API时,需注意token消耗和预算控制。此外,MirrorCode任务需要大量context window(上下文窗口),目前国产模型如Kimi的128K context已能覆盖大部分场景,但更长的持续推理能力仍是短板。

监管方面,MirrorCode涉及代码逆向生成,可能触及知识产权边界。国内开发者在使用AI重建开源代码时,需注意许可证合规性,避免侵权风险。

几条值得记住的细节

  • Claude Opus 4.7在MirrorCode上解决率56%,14小时重建16,000行代码的工具包。
  • 最复杂任务耗时19天、花费$2,600,但模型仍未完成。
  • GPT-5和Gemini Ultra 2的解决率分别为48%和42%。
  • MirrorCode基准测试将开源,供社区复现和扩展。
  • 所有模型在需要长期规划和架构理解的任务上表现不佳。

一句话总结

MirrorCode揭示了AI编程能力的真实上限:简单任务已可胜任,但复杂项目仍需人类主导。