Perplexity 发布 WANDR 基准测试:评估研究型 AI Agent 的广度和深度搜索能力
Perplexity AI 推出 WANDR,一个包含 500 个证据密集型任务的开源基准测试,用于评估 AI 研究 Agent 的广度和深度搜索能力。其 Search as Code 系统以 0.363 soft F1 领先,但所有系统均未解决该基准。本文详解 WANDR 的评估方法、结果及对中文开发者的意义。
一句话看懂
Perplexity AI 发布 WANDR 开源基准测试,包含 500 个需要广泛搜索和深度验证的研究任务,旨在评估 AI Agent 的真实知识工作能力。
详细发生了什么
Perplexity AI 推出了 WANDR(Wide ANd Deep Research),一个用于评估研究型 AI Agent 的开源基准测试和评估工具。WANDR 包含 500 个基于真实场景的证据密集型任务,要求 Agent 同时具备“广度”(发现大量符合条件的实体)和“深度”(为每个实体提供可验证的证据)。
WANDR 采用可组合的资格键层次结构(qualification key hierarchy)来定义任务。例如,一个任务可能要求找到 n 家公司、每家公司 m 名员工、每个员工 k 个支持页面。每个完整路径都会被独立验证。
Perplexity 使用自己的 Search as Code(SaC)系统在全部 500 个任务上进行了测试,取得了 0.363 soft F1 和 0.133 hard F1 的成绩,领先于 Anthropic(0.249 soft F1)和 OpenAI 等其他系统。但所有系统都远未解决该基准,最高分也仅为 0.363。
关键发现包括:部分进展常见但完全覆盖困难;规模效应加剧问题;发现(discovery)是首要瓶颈;找到可用页面容易,但提取完整证据困难。
中文圈视角
WANDR 对中文 AI 开发者和研究人员有重要参考价值。目前国内类似的开源基准测试较少,尤其是针对“研究型 Agent”的评估。国内团队可以借鉴 WANDR 的评估思路,构建中文场景下的类似测试,例如评估 Agent 在中文法律、医疗、金融领域的资料搜集能力。
对于使用国产模型(如 DeepSeek、Kimi、智谱)的开发者,WANDR 提供了一个标准化的测试框架,可以对比不同模型在复杂搜索任务上的表现。不过,WANDR 的任务主要基于英文数据源,中文用户需要自行适配中文语料。
此外,WANDR 的“证据验证”机制对国内 AI 应用的内容安全有启发意义。它要求 Agent 不仅给出答案,还要提供可重新获取的引用来源,这有助于提升 AI 输出的可信度和可追溯性。
几条值得记住的细节
- WANDR 包含 500 个任务,共需 170,495 条带来源的记录,中位任务要求 50 个成员和 245 条记录。
- 任务分为低、中、高三个难度等级,分别有 167、166、167 个。
- Perplexity Search as Code 的 soft F1 为 0.363,hard F1 为 0.133,成本约 $5.20/任务。
- 所有系统在“发现”阶段表现最差,顶级发现完成率在 0.611 到 0.951 之间。
- 即使对于 Perplexity,41.4% 的页面缺失实质性要求,57.5% 的摘录未能支持完整声明。
一句话总结
WANDR 揭示了当前 AI Agent 在真实研究任务中的能力上限,为开发者提供了改进搜索和证据提取的明确方向。