Agent 时代的芯片账本:从 tokens/s 到整套系统
跑分永远是最有说服力的营销语言。一块新卡发布,厂商恨不得把每秒几百个 Token 的吞吐数字打到幕布上,观众也习惯了用这串数字给芯片排座次。可最近翻看 Agent 相关的工程讨论,我越来越觉得这个指标像一张只拍了半边的照片:它记录了芯片有多快,却没有回答那个更要命的问题——这么快的 Token,最后有没有变成一个能交付的答案、一件能收尾的事。
原因不难理解,Agent 时代的用户请求早已不是一次简单的问答。你在聊天框里敲下一句话,后台可能是一场几十轮的接力:调基础模型做规划,换专用模型做识别,取一次向量去检索,跑一段代码,再调用外部工具,中间还夹杂着重试、回退和自我反思。每一轮都在消耗算力,峰值吞吐若换不来任务完成,那些 Token 就只是被电费、显存和折旧共同买下的中间产物。评价芯片的语言,正在从谁的单点规格最高,变成谁能把更强的模型以更低的系统成本送进真实产品。
顺着这条线看,小模型的处境反而有点尴尬。三十亿、八十亿参数规模的小模型确实跑得飞快,语音前处理、向量化、路由分发、投机解码里的草稿生成,都是它们的主场。麻烦在于,这些负载恰恰是最先被通用平台顺手吃掉的那一批:中央处理器的向量指令在进步,图形卡的推理引擎在进步,集成 NPU 和统一内存在进步,等通用算力变得足够好,再往主板上单独焊一颗小芯片就显得多余——主板、供电、散热、驱动、供应链、售后,每一项都要跟着改账,凭空多出来的物料成本,换不来对等的体验。
真正有战略位置的是另一头:能装下接近万亿参数的大模型推理专用芯片。这条路上已经站了不少名字,谷歌的 TPU 算是老前辈,国内也有几家在押注。但门槛比想象中高,模型装得下还得喂得饱,解码阶段的速度被权重和缓存数据的搬运卡着脖子,考验的是容量、带宽、先进封装和互联的真功夫;编译器和运行时得追得上模型架构的变化,混合专家、长上下文、多模态这些新玩法支持慢了,架构红利随时作废;最后还要过生态这一关,驱动、框架兼容、供应稳定、多租户隔离,每一样都决定每 Token 的服务成本能不能压到客户愿意买单。
比计算更有意思的变化发生在存储这一侧。模型缓存原本只有简单的分层,如今被硬生生拉长成一条纵深带:高带宽内存守着最热的数据,普通内存和互联扩展协议接住池化的适配器与预取缓冲,正在推动标准化中的高带宽闪存卡在两者之间,再往下是保存冷专家和历史上下文的固态盘。这个层级一旦拉开,一类新产品就顺理成章地出现了。
它就是 AI 固态盘。保持标准接口和通用形态不变,导入路径接近一次普通的存储升级,增量成本不过几十美金,而为了扩容单独设计一颗小芯片动辄近千美金。已有团队用普通服务器加内存和固态盘拼出分布式缓存层,大厂也在探索把以太网挂载的闪存当作上下文层来用。大芯片负责高价值的计算,把智能的上限抬高;固态盘用便宜的成本留住冷数据,靠预取把系统的可负担性抬起来。两者是互补,不是替代,被替代的恰恰是那些夹在中间、位置尴尬的小芯片。
硬币还有另一面。平台厂商一直在做价值内化,云巨头自研加速器,GPU 平台顺手把存储和调度都收进自家软件栈,独立芯片公司想活下来,就得占住平台够不着的控制点,要么在编译器和运行时上做出别人短期追不平的深度,要么和系统客户在存储侧联合定义出差异化的产品形态。
资本市场的注意力也在跟着迁移。一级市场开始按里程碑给推理芯片定价,从流片、样片到真实并发和整机出货,每往前走一步,估值才兑现一截;二级市场盯的是设计中标有没有变成持续订单,毛利率有没有被封装和内存成本悄悄吃掉。Agent 时代大概不会奖励所有更快的芯片,只会奖励那些让更长上下文、更多工具调用在合理成本下持续运转的系统。下一次再看到吞吐数字的时候,值得多问一句:这些 Token 里,到底有多少是有效的。