英国AI安全研究所:标准基准测试系统性地低估了AI Agent的真实能力
英国AI安全研究所(AISI)研究发现,标准AI评估因限制计算预算而低估了Agent能力。在软件工程任务中,token预算增加10倍,成功率提升约25%。前沿模型的实际进步速度比此前测量结果陡峭约60%。了解这一发现对AI能力评估和中文用户的影响。
一句话看懂
英国AI安全研究所研究表明,标准基准测试因限制token预算,系统性地低估了AI Agent的实际能力,前沿模型进步速度被低估约60%。
详细发生了什么
英国AI安全研究所(AISI)发布了一项覆盖七个基准测试的研究,指出标准AI评估方法因对计算预算设置上限,系统性地低估了AI Agent的真实能力。在软件工程任务中,当token预算增加十倍时,成功率提升了约25%。新模型受益最大,而旧模型提升有限。根据AISI的分析,前沿模型的实际进步速度比此前测量结果陡峭约60%,这意味着AI能力的增长曲线比我们之前看到的更激进。
研究强调,当前的基准测试通常限制模型在固定token数内完成任务,这无法反映Agent在真实场景中通过更多计算资源获得更好表现的能力。AISI建议,评估应纳入可变计算预算,以更准确地衡量Agent性能。该研究还指出,随着模型能力提升,测试时计算(test-time compute)的作用愈发重要,未来基准设计需考虑这一因素。
中文圈视角
这项研究对中文AI社区有直接启示。首先,国内常用的基准测试(如C-Eval、MMLU中文版、HumanEval等)同样存在计算预算限制问题,可能导致对国产模型(如DeepSeek、Qwen、GLM等)能力的低估。例如,DeepSeek-R1等模型在长链推理任务中表现出色,但标准基准可能因token限制未能充分体现其优势。
其次,对中文用户的实际影响:在编程、写作、数据分析等需要多步推理的场景中,Agent的实际表现可能比基准分数更好。这意味着用户在选择模型时,不应仅依赖基准排名,而应关注模型在长上下文或高计算预算下的表现。
此外,国内AI安全研究机构(如中国信通院、国家人工智能安全实验室)可借鉴AISI的方法,调整评估标准,避免因测试设计缺陷而低估模型风险或能力。对于开发者而言,在构建Agent应用时,应考虑为模型分配足够的计算资源,以释放其真实潜力。
几条值得记住的细节
- AISI研究覆盖了七个基准测试,包括软件工程、数学推理等任务。
- 软件工程任务中,token预算增加10倍,成功率提升约25%。
- 新模型(如GPT-5、Claude 4.5)受益最大,旧模型提升有限。
- 前沿模型实际进步速度比此前测量结果陡峭约60%。
- 研究建议未来基准测试应纳入可变计算预算。
一句话总结
标准基准测试可能严重低估AI Agent能力,选择模型时需关注其在充足计算资源下的实际表现。