bml.asia · 纯文字 · 写写停停

DeepSeek Flash 新价目表:输入回原价,输出翻一倍

中午刷到 DeepSeek 开放平台的公告,说 9 月 10 日 12:00 起调整 Flash 系列定价,空闲时段输入缓存命中 0.02 元、未命中 1 元、输出 4 元,高峰时段为空闲的 2 倍。乍一看是一份全面降价的喜报,命中价降 60%,未命中降三分之一,输出也在降。但只要把 8 月 17 日之前的基准价拉出来对一遍,味道马上就不一样了。

项目 8 月 17 日前 9 月 10 日空闲时段 变动
输入(缓存命中) 0.02 元 0.02 元 持平,回到原价
输入(缓存未命中) 1 元 1 元 持平,回到原价
输出 2 元 4 元 +100%,比涨价前还高 1 倍

把时间线捋直就清楚了。8 月 13 日 DeepSeek 宣布 API 峰谷计价,8 月 17 日零时生效,那一轮 Flash 的空闲输入被抬到 0.05 元和 1.5 元,高峰输出一度到 9 元,账面是实打实的涨价。这次号称下调,本质是把输入价格退回 8 月 17 日前的原价,输出名义上从 4.5 元降到 4 元,可对老用户来说,从 2 元走到 4 元,该翻倍还是翻倍,一分没少。

再往深想一层,为什么偏偏是输出承担涨价。Agent 时代的输出大头不在人看到的答案里,而藏在水下:思维链按输出计费,一次看似简单的回答背后可能拖着几千 token 的推理。到了 loop 循环里,每一轮的计划、工具调用和对结果的复核,也全是产出 token 的机器——写测试、跑测试、读报错、再修一轮,“验证”这个动作本身就是烧输出。输出单价翻倍,表面是对用户涨价,实质是对不受控的循环迭代征税,倒逼 harness 把验证轮次收得更紧、停机时机掐得更准。还有一层更妙的联动:上一轮的输出,到下一轮就成了输入,走 0.02 元的命中价。loop 跑得越久,历史推理沉淀得越多,后续轮次的复用就越便宜——这套价目表其实在奖励长会话、热缓存,惩罚每轮冷启动反复重新生成的用法。

更有意思的是成本结构的挪动。读多写少、缓存命中高的 Agent 工作流是赢家,夜间跑批的输入成本几乎可以忽略不计;反过来,短上下文、长输出的生成类任务两头吃亏,缓存命中率天然上不去,输出还翻倍,白天高峰时段一百万 token 要掏 8 元。峰谷这根杠杆的意图也很直白:能缓存的去缓存,能夜里跑的别搁白天跑。补贴期结束了,DeepSeek 开始按真实的使用形态收钱,这份价目表与其说是降价公告,不如说是一张使用说明书。