bml.asia · 纯文字 · 写写停停

玩腻了 Agent:所谓调教,不过是提示词对抗的循环

  把市面上的 Agent 软件挨个试过一遍,你会觉得它们“简单”得出奇一致。不管什么产品,总能找到一处设定系统提示词、约束框架的地方,剩下的事就是按自己的需求去改这些设定——加几条规则、调调人格、补点记忆约束,看起来就把 Agent 驯服了。

  可一旦越过这层壳,问题就来了。Agent 真正聪明与否,取决于模型侧的底层推理逻辑,这一层你改不了,除非自己本地部署模型。而本地部署的模型能力又普遍偏弱,跑得动但不顶用。于是卡在一个死结里:想要强能力就得用云端大模型,想用云端大模型就碰不到底层;碰不到底层,就只能在提示词上做文章。

  这就是我这两天真切体会到的玩法——提示词对抗。你针对自己的场景精心改好的提示词之所以好用,是因为模型和厂商的底层没动。一旦厂商更新了底层推理,你那套精雕细琢的约束可能瞬间失效,Agent 开始绕弯、开始不听话。这时候又得回头改提示词,再试、再失效、再改。循环往复,精力全耗在和模型的角力上,而不是在做事本身。普通用户手里的杠杆只有提示词这一根,底层一变,杠杆就晃;杠杆一晃,你就得重新找支点。

  近期大厂都在研究各种 Agent 框架,看起来热闹,但冷静看,那些东西更多是为重型工程化准备的:多智能体编排、工具链治理、可观测性体系,面向的是有团队、有基建、有合规诉求的企业场景。对普通用户来说,那套重型装备和日常“让 Agent 帮我写段代码、整理个笔记”的距离其实很远。我们能碰的依然是最上面那层提示词,框架再花哨,没解决“底层推理不可改”这个根因,普通人体验就不会本质改变。

  玩了两天,最大的感受是别神话调教。提示词是入口,不是终点,它能帮你把 Agent 拉到够用的位置,但别指望靠它突破模型能力的天花板。真要质变,要么等底层推理普惠式进步,要么自己把模型和场景一起扛下来——后者目前还是奢侈品。所以现在的我态度反而轻松了:提示词改到顺手就行,别陷入对抗的执念,剩下的交给模型自己慢慢长。