AI 快讯 编译自 the_decoder #基准测试#知识工作#模型评测

新基准测试揭示AI在真实知识工作中表现糟糕,最佳模型仅完成3%任务

一项名为GAIA的新基准测试显示,即使最先进的AI模型在真实知识工作场景中也表现不佳,完全解决率仅3%。本文解读测试细节、对中文用户的影响及国产模型的差距。

编译发布 2026/06/19 原文发布 2026/06/19

一句话看懂

新基准测试GAIA发现,AI在需要多步推理、工具调用和真实世界知识的任务中,最佳模型仅完全解决3%的问题。

详细发生了什么

The Decoder报道,一项名为GAIA(General AI Assistants)的新基准测试揭示了AI在真实知识工作中的严重短板。该测试由Meta、Hugging Face和AutoGPT团队联合开发,包含466个需要多步推理、工具使用和真实世界知识的任务,例如“找出2023年诺贝尔化学奖得主中,谁在获奖前一年发表了最多论文?”

测试结果令人震惊:即使最强的AI模型(如GPT-4、Claude 3.5)也只能完全解决约3%的任务,部分解决率约20%。相比之下,人类在相同任务上的完全解决率超过90%。模型在需要访问网页、调用API、处理PDF等真实场景时频繁出错,暴露了当前AI在复杂知识工作上的根本局限。

中文圈视角

对中文用户而言,GAIA测试结果有几点直接关联:

  1. 国产模型差距可能更大:目前DeepSeek、Kimi、智谱等国产模型在类似多步推理任务上的表现尚未公开评测,但根据其基础能力推测,完全解决率可能低于1%。中文用户在使用AI辅助研究、报告撰写时,需对结果保持高度警惕,尤其是涉及多来源信息整合的任务。

  2. 工具调用能力是关键短板:GAIA测试中,模型需要调用搜索引擎、计算器、数据库等工具。国内模型在tool calling方面普遍弱于GPT-4,且中文网络环境下的工具兼容性更差(如百度搜索API、微信数据等)。这意味着中文用户的实际体验可能更糟。

  3. 监管与数据安全盲点:测试中模型需要访问外部网站和API,这在国内可能触发数据出境或内容安全风险。中文用户若使用海外模型完成此类任务,需注意合规问题。

几条值得记住的细节

  • GAIA测试包含466个任务,涵盖多步推理、工具使用、真实世界知识三个维度。
  • 最佳模型GPT-4完全解决率仅3%,部分解决率约20%,人类完全解决率超90%。
  • 测试由Meta、Hugging Face和AutoGPT团队联合开发,旨在评估AI助手的实际能力。
  • 模型在需要访问实时数据(如新闻、数据库)的任务中失败率最高。
  • 测试代码和数据集已开源,开发者可自行评估模型表现。

一句话总结

别指望AI能独立完成复杂知识工作——它连最简单的多步推理都经常翻车,中文用户尤其需要手动验证结果。