AI搜索代理在执行多步研究时,失败往往不是因为搜索技术,而是因为当用户查询模糊时,它们不会主动请求澄清。新发布的基准测试DiscoBench发现,那些反复搜索而不追问的模型,准确率仅51.9%,甚至低于随机猜测。即使表现最好的模型,整体准确率也只有43%。然而,一旦从查询中消除歧义,准确率可跃升多达40个百分点。这表明,提升AI搜索代理的关键在于增强其主动提问的能力,而非改进搜索算法。
AI搜索代理失败不在搜索本身,而在于不会在模糊查询时提问
新基准DiscoBench显示,AI搜索代理在多步研究中失败的主因是不向用户澄清模糊查询,而非搜索能力不足。即使最佳模型准确率也仅43%,而消除歧义后准确率可提升40个百分点。
The Decoder1 分钟阅读

本文由 UsingAI 聚合整理。
阅读原文 ↗

