AI搜索代理失败根源不在搜索,而在模糊查询时不会追问用户
新基准DiscoBench揭示AI搜索代理的软肋:面对模糊查询时,反复搜索不如主动追问。最佳模型准确率仅43%,消除歧义后提升40个百分点。本文分析对中文用户使用AI搜索的启示。
一句话看懂
AI搜索代理在多步研究中失败的主因不是搜索能力,而是面对模糊查询时不会主动向用户追问澄清,导致准确率远低于预期。
详细发生了什么
一项名为DiscoBench的新基准测试发现,AI搜索代理在多步研究任务中表现不佳的根本原因并非搜索技术本身,而是它们在遇到模糊查询时缺乏主动追问用户以澄清意图的能力。
测试显示,那些在模糊查询下反复搜索而不向用户提问的模型,准确率仅为51.9%,甚至低于直接猜测的模型。所有参与测试的模型中,表现最好的整体准确率也只有43%。然而,一旦从查询中移除歧义,准确率最高可提升40个百分点。
这意味着,当前AI搜索代理的设计存在一个关键盲点:它们更倾向于盲目执行搜索,而不是像人类助手一样,在不确定时主动确认需求。DiscoBench专门设计来评估模型在需要澄清的模糊场景下的表现,结果凸显了交互式追问能力的重要性。
中文圈视角
这个发现对中文用户尤其值得关注。目前国内主流的AI搜索产品(如秘塔AI搜索、天工AI搜索、360AI搜索等)大多强调“多步推理”和“深度搜索”,但用户实际体验中常遇到答非所问的情况——很可能根源就在于模型没有对模糊表述进行追问。
中文天然具有更高的歧义性(同音字、多义词、语境依赖强),比如搜索“苹果”可能指水果或公司,“小米”可能是手机品牌或粮食。如果AI搜索代理不主动追问,而是直接搜索,结果很可能偏离用户意图。
相比之下,国外产品如Perplexity AI已经开始引入“追问”机制,但国内产品在这方面的交互设计仍较薄弱。对中文用户而言,一个能主动说“您是指XX还是XX?”的搜索代理,远比一个默默搜索但给出错误答案的代理更有价值。
此外,该研究也提示开发者:在训练中文AI搜索模型时,应加入更多需要澄清的对话数据,并设计明确的追问触发策略,而不是一味优化搜索算法本身。
几条值得记住的细节
- DiscoBench基准测试专门评估AI搜索代理在模糊查询下的表现,重点考察追问能力。
- 反复搜索但不追问的模型准确率仅51.9%,比直接猜测还差。
- 最佳模型整体准确率仅43%,说明当前AI搜索代理普遍缺乏有效追问机制。
- 消除查询歧义后,准确率最高提升40个百分点,显示追问对结果质量的巨大影响。
- 该研究由独立团队完成,测试覆盖多种主流AI搜索模型。
一句话总结
下次用AI搜索时,如果结果不理想,不妨想想:是它没搜对,还是它根本没问清楚你想要什么。