AI 快讯 编译自 the_decoder #AI编程#基准测试#代码搜索

AI编程代理找对文件却找不对关键代码行,SWE-Explore基准测试揭示短板

新基准SWE-Explore首次将代码搜索与修复分开测试,发现Claude Code、Codex等AI编程代理虽能准确定位文件,但多数情况下遗漏关键代码行。对中文开发者而言,这意味着依赖AI修复bug时需人工校验定位精度,国产工具如通义灵码或需针对性优化。

编译发布 2026/06/14 原文发布 2026/06/14

一句话看懂

新基准SWE-Explore首次单独测试AI编程代理的代码定位能力,发现它们找对文件却找不对关键行,修复效果大打折扣。

详细发生了什么

一项新研究显示,像Claude Code和Codex这样的AI编程代理在定位代码时,能准确找到相关文件,但往往遗漏文件中真正需要修改的关键行。研究人员推出了SWE-Explore基准测试,这是首个将代码搜索能力与修复能力分开评估的测试。

该基准包含来自真实项目的代码缺陷,要求代理先定位问题所在的行,再尝试修复。结果发现,即使代理最终修复成功,其定位准确率也远低于预期。例如,在部分任务中,代理虽然找到了正确的文件,但定位到正确代码行的比例不足30%。这表明,缺乏精确的上下文理解是当前AI编程工具的主要瓶颈。

研究强调,没有足够的上下文,即使最强大的修复模型也会失败。SWE-Explore的发布为开发者提供了一个独立评估代码搜索能力的工具,有助于未来改进AI代理的上下文感知能力。

中文圈视角

对中文开发者来说,这项研究有直接参考价值。目前国内主流AI编程助手如通义灵码、CodeGeeX等,同样依赖代码定位能力。虽然这些工具在文件级别表现不错,但行级定位的短板可能导致修复建议偏离实际需求。

一个典型场景:开发者用AI代理修复一个Python函数中的bug,代理定位到了正确的模块文件,但建议修改的却是另一段无关代码。这在实际项目中会浪费大量调试时间。

此外,SWE-Explore基准目前基于英文开源项目,中文项目(如包含中文注释或变量名)的定位效果可能更差。国产工具厂商应关注这一维度,在训练数据中加入更多中文代码场景,或开发类似的中文代码定位基准。

对于普通开发者,建议在使用AI编程代理时,不要完全信任其定位结果,尤其在复杂函数或长文件中,应手动确认修改位置。

几条值得记住的细节

  • SWE-Explore是首个将代码搜索与修复分开测试的基准,由研究团队基于真实项目构建。
  • 测试中,AI代理定位正确代码行的成功率低于30%,尽管文件定位准确率较高。
  • 研究指出,缺乏上下文是导致定位失败的主因,而非修复能力不足。
  • 该基准可独立评估代码搜索能力,帮助开发者选择更精准的工具。
  • Claude Code和Codex等主流代理均参与了测试,结果具有代表性。

一句话总结

AI编程代理找文件很准,但找关键行还差得远,用它们修bug时记得自己再确认一遍。