Jev 模型是什么:当 AI 的判断被单独拿来卖
用惯了大模型的人,思维里都有一个默认前提:AI 的产出是文字,按生成的 token 数计费,写得多就贵,写得慢就等。最近一款叫 Jev 的模型把这个前提直接掀翻了。它不写文章、不写代码、不做解释,功能只有一个:判断。用法是给它一段材料和几个备选答案,它从中锁定一个选项,同时报出一个把握度的数字,整个输出就这么多。比如递进去一份财报材料和几个增速数字,问其中报的营收增速最接近哪个,它直接给出答案并附上把握度,吐出的内容还凑不满一句话。发布方 TypeSafe AI 的创始人在 OpenAI 待过四年,参与过 InstructGPT 那一代工作,团队给这个产品的定位很直白:把判断力单独做成一个品类,单独计价。一次判断不到 0.001 美元,因为不逐字生成,速度比常规大模型快几十倍。计价单位从字数变成次数,这件事听起来小,实际上把 AI 从一种“内容生产服务”变成了一种可以批量采购的“零件”。
有媒体拿近两百次财报判断任务去实测它,结果很能说明这类模型的脾气。基础事实题几乎全对,问某家公司中报里的某个数字,它稳稳给出正确选项,把握度拉满。可一旦题目需要计算,比如毛利率变化贴着分界线走,它就开始出错,而且错得理直气壮:同一道题换两种问法问十次,十次全错,每次把握度都超过八成。这不是 Jev 一家的毛病,而是所有判断型模型的共性——置信度衡量的只是给定选项之间的相对倾向,并不衡量答案本身的对错。最危险的局面从来不是低把握时的犹豫,而是高把握下的错误且不自知。所以围绕这类模型搭建工作流的人,往往把规矩定得很硬:算术必须留在代码里,取数、口径对齐、比率计算全部交给程序,模型只负责在备选项里做最后的选择,阈值再由人工校准兜底。
真要问它主要用在什么领域,答案其实是横切的,哪个行业都有“从几个既定选项里挑一个”的需求。金融和财务分析是最直接的试验场:核数、口径比对、从成堆材料里锁定某个数字落在哪个区间,这类任务人做起来费眼、量大又机械,正是判断器的舒适区,只是贴线的计算得交给代码兜底。企业内部运营是走量最大的场景:客服工单按内容自动分派、退款申请归入对应类别、合同条款做风险初筛、成堆的文档先预筛一遍再交给人工细看,这些事单价极低、频次极高,以前靠规则引擎做不准,用大模型做又太贵,一次判断千分之一美元的价位刚好把中间这个夹层填上了。更值得注意的是给 AI 工作流“叠甲”的用法:大模型的敏感操作在执行前,先用它判断一次是否需要人工审批,转账、删除、对外发送之前都过一道闸,等于给自动化流程配了一道便宜的安全栓。它不和大模型抢饭碗,而是嵌进别人的工作流里当零件,这个生态位比模型本身的参数更耐琢磨。
名字里的杰文斯,指向 19 世纪那个著名的悖论:蒸汽机效率提高,煤的消耗反而不降反升。判断成本跌到千分之一美元一次,用量大概率也是同样的剧本:原本因为贵而不划算的判断需求,会像便宜下来的照明用电一样被成倍释放出来,这些判断单独看都不起眼,乘上每天成千上万次的调用量,才撑得起一个新品类。真正值得琢磨的另有其处:模型账单便宜了,成本却转移到了选项设计、数据核对和复核流程上,价值流向出题的人和设计流程的人。国内做检索、排序、判断的技术储备并不缺,智源的检索模型、Qwen3 的排序模型都在做同类判断,缺的只是把它们包装成独立品类单独计价的那个动作,这个空白被谁先填上,倒是一个比模型本身更有看头的问题。