bml.asia · 纯文字 · 写写停停

最新 从 Chat 到 Agent:Vera Rubin 背后的算力逻辑

读完英伟达副总裁 Ian Buck 关于 Vera Rubin 平台的演讲,最让我在意的不是新芯片本身,而是一组关于负载形态的对比数字。当年 Chat 模式的基准测试,模型输入大约只有 1K 词元;如今的 AgentX 基准里,平均输入规模已经涨到 142,000 词元,动态范围从 1K 一直延伸到 200K 以上,上下文缓存能装下 100 万词元,智能体单次任务的交互轮数可以冲到 65 轮。人类被从交互循环里拿掉之后,算力进入高频满载状态,纯数值层面的需求提升了 100 倍。这不是原来那点需求乘个系数的问题,而是负载从“问答”变成“委托”的结构性跃迁。

沿着这组数字往下看,评价体系的变化就顺理成章了。Ian Buck 有句话说得相当直白,唯一关键的指标是每兆瓦的总词元吞吐量。行业过去习惯拿单芯片 FLOPs 和单卡跑分来比拼,但当一个数据中心被当成 AI 工厂来经营时,真正决定营收能力的是每一瓦电换回多少词元。降本的逻辑也随之重写——降低词元成本最有效的方式不是压低 GPU 售价,那只能改善庞大体系里细小的一环,而是让每一代产品交出 10 到 30 倍的性能跃升,直接把单位词元成本摊薄,而 Vera Rubin 承诺的正是这个量级,智能体场景吞吐量提升 30 倍,部分场景能到 60 倍。

平台本身的细节也值得多看两眼。这代 Vera CPU 拥有 188 个核心,内存延迟比上一代低 40%,跑 Terminal Bench 提升 1.6 倍,工具调用快 60%,核心任务最高能快 2 倍。这些看似平淡的数字背后是智能体工作负载的真实痛点,agent 的大量时间其实花在调用工具、跑沙盒、读写文件这类 CPU 密集环节上,所以 Perplexity Space 沙盒的速度能因此提升 1.5 倍。再配合 NVLink Fusion 把接口开放给更多供应链伙伴,以及 Groq LPU 在极致延迟场景下的补位,这套全栈架构的思路很清楚,就是让每一家想自建智能体系统的公司都能在同一个生态里找到自己的位置。

把视线从单点性能挪到整个棋盘上,英伟达真正难以撼动的其实是生态位:超过 1000 万名开发者、300 多家供应链公司、8000 多个 CUDA 应用,再加上 Hugging Face 上 300 多万个模型,这套护城河短时间里看不到对手。产品节奏也被压缩到年度一更,从 Vera Rubin 到 Vera Rubin Ultra,再到之后的 Feynman,路线图一路排到了下个周期。当算力需求以百倍计放大、评价标准落到每兆瓦词元吞吐量上,这场竞赛比拼的早已不是某一块芯片的峰值参数,而是整套体系能否持续兑现性能承诺的能力。


更多文章

查看全部 208 篇文章 →