bml.asia · 纯文字 · 写写停停

很多问题不必联网搜索:大模型的基准能力已经够用

以前用 AI 有个改不掉的习惯:不管问什么,都先把联网搜索打开,好像不搜一下心里就没底。查个资料要搜,写段代码要搜,甚至连一个成语是什么意思,都想让它先去网上转一圈再回答。搜索框像是我的安全带,系上了才敢往前开。直到最近整理一批问题的时候,我试着把联网关掉,直接让模型用自己的本事作答,结果出乎意料——很多回答不但没有变差,反而更快、更干净,也更像是一个完整的思路,而不是几段网页摘要拼起来的拼盘。

细想之后发现,这背后其实是个很朴素的变化:模型自己的基准能力,已经强到可以覆盖日常大部分问题的程度了。语言理解、逻辑推理、代码编写、方法论整理,这些能力在一次次的版本迭代里被反复打磨,大量原本需要去外面查的东西,其实早就内化进了权重里。而我还在用几年前养成的惯性去对待它,总觉得它是个需要随时补课的学生。实际上学生早就毕业了,是我没有及时更新对他的印象。

联网搜索并不是不好,它有自己的用武之地。但在很多场景下,它带来的成本被低估了。搜索结果的质量取决于搜到了什么页面,页面本身可能过时,可能是 SEO 味道浓重的内容农场文章,也可能干脆答非所问;模型要先读网页、再提炼、再组织语言,中间每一步都可能引入噪音。一个简单的概念问题,本来一句内化的回答就够了,套上搜索之后反而变成根据某个网站的说法如何如何,把干净的答案稀释成了二手转述。慢,还未必更准。

更关键的是模型迭代的速度。现在的模型更新是以月甚至周为单位的,这一版不会的题,下一版可能就熟了;这一版还需要外挂搜索来补的短板,下一版可能已经补齐。而人对模型的印象是滞后的,往往停留在某一次糟糕的体验上,然后长期不信任。这种滞后会让使用方式也跟着过时:明明模型已经能直接做好的事,还在固执地给它配一堆工具,就像一个人已经学会了骑自行车,你还坚持要在旁边扶着车座推着他走。

所以现在我给自己定了一个简单的取舍标准:强时效的事实,比如今天的新闻、实时的价格、某个软件刚刚发布的版本号,仍然交给联网搜索,因为这些东西不在模型的权重里,也没法在里面;而概念、方法、推理、写作这一类问题,尽量直接交给模型本身,先相信它的第一反应,答不好再补搜索也不迟。说到底,工具是死的,模型是活的,它每天都在变强。我们对它的信任,也得跟上它迭代的速度,不然手里握着一把越来越锋利的刀,却还在用旧的力气切菜。