bml.asia · 纯文字 · 写写停停

AI 时代的网络调研:信源才是根

最近帮朋友核对一组行业数据,又被网络调研这件事教育了一回。他现在查东西的习惯,是直接把问题丢给 AI 聊天机器人,得到的回答条理清楚、语气笃定,还带着几个看起来很专业的数字。可当我追问一句这个数据从哪来的时候,对话里要么给不出出处,要么编出一个打不开的链接。后来我顺着线索自己查,发现官方早就发布过口径完全不同的新数据,而 AI 说的还是几年前的旧账。整个过程没花多少时间,却再次确认了我一直以来的一个感受:这个时代从来不缺能查到的东西,如今 AI 更是把获取答案的成本压到了几乎为零,可缺的恰恰是知道该信谁。很多人把调研理解成提问的技巧,以为换个问法、多问几轮就算调研了,其实技巧只是外壳,信息源才是里子。信息源不对,后面的一切推理都等于在沙子上盖房子,问得越勤快,偏得越远。

先把话说公道一点,用 AI 做调研本身并没错,我自己也离不开它。开一个陌生课题的时候,我会先让 AI 把领域的基本框架、关键术语、代表性争议梳理一遍,几分钟就能拿到过去要翻半天资料才能拼出的地图;让它总结一篇几十页的报告,把外文材料变成能快速消化的中文,也都非常称职。但要紧的是摆正它的位置:AI 是引路人,不是资料库。它可以告诉你这片森林大概长什么样,可你不能把它的转述直接当成树本身。大模型的回答本质上是基于训练数据的概率拼贴,行文越流畅,越容易让人觉得它句句有据,实际上幻觉和过时信息就混在其中,而且语气不会给你任何提示,越是冷门领域或新近发生的事,它一知半解时也照样答得头头是道。

所以无论工具怎么变,我那条笨原则依然管用:能靠近源头就靠近源头。研究任何问题,最先要问的不是答案是什么,而是这个答案最早是谁说出来的。AI 的回答要当线索用,顺着它提到的报告名、论文标题、机构名称去翻一手材料,比如官方文档、上市公司财报、学术论文、政府公开数据这一类。这些内容的作者不靠吸引流量吃饭,说错了要担责任,措辞自然克制得多,数字后面往往还跟着口径和注释。一手材料读起来费劲也不要紧,哪怕只是搞清楚几个关键术语,再拿术语去重新检索,质量立刻就不一样了。还有个实用的小技巧,是直接要求 AI 给出可核验的出处,然后亲手去验证链接是否真实存在、内容是否对得上,核对这一步千万不能省,因为编造得最像真的参考文献,恰恰只存在于模型的想象里。

还有一个容易被忽略的思路:别把搜索引擎和 AI 问答当成全部。它们擅长的是热度与流畅,而不是质量,真正有价值的内容往往藏在垂直渠道里。学术问题去论文库里检索,软件问题直接翻官方仓库的文档和 issue 区,行业问题找行业协会和咨询机构的公开报告,实在不行就发邮件打电话去问当事人,效率常常高得惊人。我印象很深的一次,是查某个开源库的兼容性问题,问了 AI,得到三套方案,其中两套针对早已废弃的旧版本,最后在项目的 issue 区里翻到维护者本人的回复,三行字就把问题说透了。信息本身不会主动跑来找你,它在哪,你就得去哪,这才是调研该有的样子。

挑好了源头,交叉验证的习惯也得跟上。单一来源说得再笃定,也不代表它就靠谱,我通常会找两三个彼此独立的渠道互相印证。这里的独立二字很要紧,十篇文章转述同一份报告,看起来声势浩大,实际上只有一个信源,等于什么都没验证;几轮 AI 对话互相印证也是同理,模型之间的知识高度同源,谁也证明不了谁。如果不同立场、不同动机的信源都指向同一个事实,可信度才算真正高了起来。另外要养成看时间戳的习惯,很多流传甚广的文章其实是几年前写的,数据和规则早就变了;用 AI 也要留意,模型的知识天然带着训练截止日期,过时得悄无声息。追引用链条是我后来才学会的招,看到一篇列了很多文献的文章,就顺着脚注去翻原文,常常能发现转述和原意之间的偏差,有时偏差大到让人怀疑作者根本没读完,只是挑了一句对自己有利的话来用。

至于具体怎么给信源分级,我的做法很朴素:官方原始出处是第一档,直接采信但保留查证记录;专业媒体和学者算一档,参考价值高,但要留意立场和利益关联;普通自媒体、匿名帖子和给不出出处的 AI 回答,基本只能当线索用,顺着它们去找真正的一手材料,本身不进结论。存档的习惯也值得说一句,看到重要内容随手存一份快照,网页被删、链接失效是常态,写进文章里的每个数字都应该经得起半年后回头再查。工具和提问技巧年年都在变,而 AI 只会让答案来得更快、更顺,可“这条信息到底从哪来”这个问题,永远值得在采信任何一个答案之前,先问自己一遍。毕竟调研的目的从来不是把页面填满,而是让最后落在纸上那几行字,站得住脚。