bml.asia · 纯文字 · 写写停停

Agent 调研不准的根因:Query 对不上人脑

这段时间我养成了一个习惯,凡是要查资料、做调研,第一反应就是丢给 Agent。省事是真省事,交代一句需求就能等结果,可拿回来的东西经常让人皱眉:要么数据明显不准,出处可疑甚至对不上事实;要么冗余信息堆成山,真正想要的那两三行淹没在 SEO 味十足的内容农场文章里,筛选成本比自己动手搜还高。几次下来我不禁怀疑,问题可能不在调研这个动作本身。

一开始我以为是 Agent 不够聪明,换了好几个工具、改了好几版提示词反复试,问题依旧。后来专门做了多轮对照测试:同一个问题,先让 Agent 联网查,再自己手动搜,逐条比对它发出的搜索词。结果很明显,根因出在 Query 上——Agent 联网调研时构造的搜索词,和人脑里真实的检索意图对不上。我脑子里想的是一个很具体的诉求,带着上下文、时间范围、排除条件,而 Agent 把它翻译成搜索词的时候,这些限定信息大量丢失,出来的结果自然又散又偏。Query 本身就歪了,后面的检索再努力也是徒劳。

更麻烦的是,这种偏差还不容易被察觉。Agent 拿回一页结果之后,会用很流畅的语言把内容复述一遍,读起来头头是道,但源头可能只是一篇为了排名堆砌关键词的文章。搜索词失真加上结果筛选失真,两层误差叠加,调研结论的可靠性就被打了折扣。还有一类失真更隐蔽:Agent 倾向于给出一个看起来确定的答案,把不同来源的说法揉成一段圆滑的表述,真假信息混在一起,反而比明显糟糕的结果更难识别。人脑筛选的价值也就在这里,一眼就能看出哪个来源是权威的原始出处,哪个是二手转述,哪个说法在几个来源之间对得上、哪个对不上。这种判断依赖背景知识和常识,恰恰是当前 Agent 最缺的一环。

想通这一点之后,我换了个做法:调研的关键环节重新回到搜索引擎,用百度的高级搜索功能自定义 Query,把限定词、排除词这些本来只存在于我脑子里的约束,连 site 这类语法限定也亲手写进搜索式里,输出的结果网页再由我自己逐条筛。机器负责广度,人负责判断,这个分工看似退回到了旧时代,精准度反而明显上去了。而且这个过程还有一个附带的好处:亲手构造 Query 的同时,其实也在逼自己把模糊的需求想清楚,搜得越准,问题定义得越清楚。

这大概也解释了为什么不少 Agent 调研产品的实际效果总是不尽如人意——瓶颈未必出在模型的推理能力上,而是出在检索环节的意图保真度上。AI 时代的检索,恐怕不会是 AI 完全接管一切,而是变成一种需要刻意保留的手艺。至少在意图保真度这个问题被认真解决之前,把最终筛选权留在自己手里,是成本最低也最稳妥的方案。