bml.asia · 纯文字 · 写写停停

Agent 时代的渗透率与 Token 账本

过去谈 AI 的渗透,习惯拿用户数乘以客单价,一套互联网时代留下的算账办法。这套办法在聊天机器人时代还算凑合,毕竟一个人的用量撑死就是一天几百次提问。等到这一代 Agent 真能操作电脑、跑完整条工作流,“把事情做完”开始替代“回答问题”,账本就得重写了:一个人不再只是一个用户,更像一个调度员,手底下可能同时跑着好几个数字员工。所以现在的渗透率,指的是被 Agent 接管的任务占全部可接管任务的比例,它衡量的不再是多少人装了这个软件,而是多少活儿真的交给了机器。过去盯的是人头,现在盯的是任务量。算法一换,增长的天花板就完全是另一回事了。

真正有意思的是 Token 这笔账的算法也跟着变了。总需求大致等于 Agent 数量、每个 Agent 承担的任务数和单个任务的消耗量三者的乘积,而这三个乘数如今在同时往上抬。原先一个人守着的一个 Agent,会变成同时待命的一整排;原来零碎的问答,会变成整段整段的委托。模型越强,人就越敢把复杂的长链条活儿整个交出去,推理链越长、上下文越厚,单个任务的消耗量也跟着水涨船高。三个乘数一起动,很容易出现一种反直觉的局面:数量上只涨了两成,Token 总需求却翻了三四倍。过去默认算力和用量大体线性挂钩,往后这个直觉大概率会失灵,算力需求的曲线可能比所有人预想的都要陡。

再往深一层看,需求曲线变陡还有一个自我强化的来源。训练这一代模型所用的算力规模已经到了 10 万卡的量级,而且 AI 本身已经开始参与训练模型这件事:更强的模型干出更多的活,干出来的活又沉淀成更高质量的数据,反过来喂出更强的模型。这个飞轮每转一圈,都意味着下一圈要烧掉更多的电和更多的芯片。对我们这些普通使用者来说,体感上的变化其实更朴素:以前是去问它一句,后来是让它写一段,往后很可能是给它一个邮箱、一个代码库和一句目标,然后去过自己的周末。当软件从工具变成员工,渗透率得重新算过,而 Token 的算法也得跟着重来,连整个行业的账本都要翻新一遍。