生产环境选模型:稳定比免费和追新更值钱
前几天又刷到一场新模型的发布会,跑分一张比一张漂亮,评论区一片“遥遥领先”,紧接着就是各家厂商轮番的免费额度促销。说实话,我也曾被这种节奏带着走过:新模型一出就迫不及待切换过去,看到免费 API 就先薅一把再说。demo 里确实惊艳,测试 prompt 也确实省钱,可等把这些模型真的放进生产环境跑业务,我才慢慢咂摸出味道来——发布会上的评价标准和生产环境要的东西,根本不是一回事。
免费这件事,账往往不能只看表面。免费额度背后通常是低优先级的算力队列,高峰期请求排队、限流收紧都是常态,运气差一点还会碰上突然缩水甚至直接下线的配额。省下来的 API 费用,很可能在别处加倍还回去:为了兜底免费渠道的不确定性,得写一堆降级重试的逻辑;半夜服务悄悄挂掉,排查时间折算成工时早就不便宜了。对一个跑着真实业务的项目来说,成本不只是账单上的数字,还包括可预测性——而免费恰恰是最不可预测的那一档。
追新的问题则不太一样,新模型未必不好,而是没被足够多的人踩过坑。小版本无声更新之后,prompt 的表现可能悄悄变了,之前调好的输出格式、工具调用习惯突然就失效,而你也许过了好几天才从用户的反馈里察觉。benchmark 上好看的长上下文、函数调用能力,边界条件往往要靠大量真实流量才能暴露出来。生态跟不上也是个现实问题:结构化输出、批处理、缓存这些生产刚需特性,新模型经常要等好几个月才补齐。
生产环境真正在乎的东西,掰开来看其实都是“稳定”的子集:输出质量可复现,回归测试才有意义;可用性有保障,业务才敢往上面压;行为变更可预期,出了问题才知道往哪查。所以我现在的做法是把模型当成依赖来管理,像锁 npm 版本一样锁定模型的具体版本号,再用别名区分灰度和稳定两条通道,新模型先放到旁路流量上跑 A/B,看真实任务的胜率和成本曲线,而不是盯着发布会的大屏做决定。
当然,强调稳定不等于守着老模型不动。旧版本停留太久,供应商迟早停服,成本效率的差距也会越拉越大,那才是最大的不稳定。比较健康的节奏是“追新可以,别在生产上追”:新模型先进观察名单,观察期过了再进生产池,准备退役的老模型提前留好迁移窗口。说到底,稳定不是拒绝变化,而是让每一次变化都发生在自己预期之内——选模型这件事,从来没有一劳永逸的最优解,只有当下最可预期的那个选择。