bml.asia · 纯文字 · 写写停停

大模型效果不好怎么办:是数据的锅还是模型的锅

平时聊天里最常听到的一种吐槽,是说大模型笨,问什么答非所问,换了个更大的模型也还是那个样子。这话有它普遍的道理,只是把原因全归到模型头上,多少有点冤枉。模型本质上是在学习数据里的模式,如果一类任务几乎没进过训练数据,不管是小众的专业知识、非常冷门的格式,还是公司内部那套外人看不懂的业务逻辑,它就是没见过,没见过的东西它只能靠编,输出自然胡说八道,也就是常说的“大模型幻觉”。这种时候只要喂上高质量示例,无论是预训练阶段直接灌进去、用 RAG(检索增强生成)现查现用,还是做少量微调(SFT),能力立刻肉眼可见地涨上来。很多企业直接拿开源小模型配上私有知识库,效果就已经够用,正因为这类场景的瓶颈确实在数据,不在基座本身。于是很容易得出一个直觉:只要数据够多够好,模型本身强不强无所谓。

但同样一份数据,交给强基座和弱基座,结果真的是天差地别。弱模型容量有限,一万条高质量样本堆过去,它记不住也学不透,很容易过拟合,把训练样例背得滚瓜烂熟,提问稍微改个说法就当场崩掉,泛化能力差得可怜;强模型能从同样几十条示例里提炼出一套通用逻辑,学的是规律而不是答案。更要命的是,推理能力、抽象能力这类原生本领,数据是补不上的。纯逻辑推导、多步骤的链式思考、复杂数学、长文本里多个条件的权衡,弱模型就算拿到一堆题和答案,它能背下的也只是见过的题型,一旦出现全新组合、从没见过的逻辑链条,没有现成样本可抄,它就直接不动了。见过的事情,靠数据就能搞定;从没见过的问题,才真正考验模型本身的智力。脏数据和矛盾信息也是一样,强模型能分辨冲突、做取舍,弱模型很容易被垃圾数据带偏,学一身错误模式还不自知。

落到现实里,大模型选型的问题,其实可以沿着两条任务边界分清。一类是模式固定、重复性强、答案样本现成的活,比如固定格式的摘要、业务问答、模板化文案、已知知识库的查询,这类场景的瓶颈优先在数据,只要数据准备到位,中等甚至偏小的模型完全够用,基座弱一点影响不大,绝大多数企业内部场景都属于这一类,很多人觉得模型不需要很强,正是因为天天做的都是这类事。另一类是开放式的活,复杂规划、深度分析、创造性写作、拆解没见过的难题,瓶颈在模型的原生能力,数据再多也不可能穷尽世间所有新问题,基座不行,喂再多也救不回来。

现在大众吐槽大模型弱,两种情况其实都存在:一种是要的是小众或私有知识,没有对应数据所以答不好;另一种是需要深度推理,这件事本身就缺少足够的示范数据,模型的原生推理能力又各有上限,双重受限。人也容易掉进两个极端,一边是一切都怪模型不行,拼命换更强的模型,业务数据从来不整理,结果照样不好用;另一边是觉得把数据堆上去就万事大吉,模型随便选,遇到稍微需要变通的问题直接翻车。实际工程里比较务实的选型思路,是看任务的性质来分配预算:简单、重复的业务场景,用好一点的中等模型,配上高质量数据和检索增强,就足够应付;真正复杂、对质量有要求的任务,必须上强基座,再用数据去做进一步的对齐和优化。会什么知识、懂什么业务,数据说了算;能不能举一反三、扛住没见过的新情况,模型本体说了算。分清这两件事,很多关于大模型的争论,其实也就没必要吵了。