关掉搜索之后:网页版 AI 竟然输给了我自己的 OpenClaw
周末闲来无事,我给自己出了一个小测试:把网络搜索关掉,只靠模型自身的认知来回答问题,同一个问题分别抛给网页版 AI 和我本地部署的 OpenClaw。原本没抱什么预期,权当消遣,结果却让我愣了几秒——网页版的回答明显更浅,几个需要推一步再推一步的问题,它轻飘飘地就绕了过去,而本地那个 OpenClaw 慢慢悠悠地把推理链条走完,答案反而更扎实。变数当然很多,模型版本、提示词、采样参数都可能影响结果,单次对比说明不了什么,但这个反转本身足够有意思了:按理说网页版背后是更新更快的旗舰模型,怎么反而比不过自己部署的这份开源实现?
想了想,答案可能藏在最近这两年整个行业最执着的那件事上——提速。各家产品都在抢首字延迟,抢流式输出的顺滑感,抢「你还没回车它已经开始吐字」的体验。但速度从来不是免费的:要快,就得压思考预算,砍掉中间那些看起来冗长的自我推敲环节,让模型在更少的隐式推理步数内给出答案。这对大多数日常场景确实无伤大雅,问天气、改邮件、写周报,快就是正义。可一旦问题需要真正的深度思考,被压缩掉的推理链路就成了看不见的短板。网页版 AI 是给千万用户设计的公共服务,延迟和算力成本必须在产品层面反复权衡;而本地部署的 OpenClaw 是给自己用的,它没有首屏指标要交差,可以慢条斯理地把一个问题想透。同源的模型能力,在两种不同的约束下,表现出了肉眼可见的落差。
更有意思的是这场提速竞赛里的取舍逻辑。发布会上的语速比拼、榜单上的响应时间,都成了可以直接营销的数字,而「因提速损失的推理深度」从来不会出现在任何一张幻灯片上,它只在用户提了个真正烧脑的问题时才悄悄显形。服务商没有错,在大众市场里,九成以上的使用场景确实用不到深思考,把资源投在速度上是最理性的商业选择;错位的是我们的预期——把网页版的快当成了全部,却忘了它交付的是一个被剪枝过的模型。本地部署在这两年变得火热,除了隐私和数据主权的考量,恐怕也和这种错位有关:愿意自己折腾一套 OpenClaw 的人,多半正是那些宁可贵几秒也想拿到完整答案的用户。
速度与深度的拉锯短期内不会落幕,毕竟延迟是最容易被感知、也最容易写进评测的指标,而思考质量需要用户付出耐心才能兑现。但肉眼可见的趋势是,本地推理的门槛正在快速下降,消费级硬件就能跑出可用的效果,「自己养一个可以慢慢想的模型」正在从极客玩具变成一种现实选项。下次再有人抱怨 AI 变笨了,不妨先问问另一个问题:它究竟是变笨了,还是被要求跑得太快了。