AI搜索代理在执行多步研究时,失败往往不是因为搜索技术,而是因为当用户查询模糊时,它们不会主动请求澄清。新发布的基准测试DiscoBench发现,那些反复搜索而不追问的模型,准确率仅51.9%,甚至低于随机猜测。即使表现最好的模型,整体准确率也只有43%。然而,一旦从查询中消除歧义,准确率可跃升多达40个百分点。这表明,提升AI搜索代理的关键在于增强其主动提问的能力,而非改进搜索算法。