bml.asia · 纯文字 · 写写停停

没有机制支撑的信心:AI Agent 治理的裂缝

最近跟几个在业务里落地 AI Agent 的团队聊天,发现一个耐人寻味的共性:问起治理有没有把握,几乎所有人都说问题不大,安全可控、流程完备;但只要追问一句“具体靠什么机制兜底”,话头就会明显虚下来。有人说模型本身够聪明,有人说供应商承诺了安全对齐,还有人干脆把 hope 包装成 roadmap。这让我开始留意一个现象——组织对 Agent 可控性的信心,普遍跑在真实控制能力的前面,而且这个落差比大多数人愿意承认的要大。

这种信心错位不是态度问题,而是传统软件治理的经验在 Agent 面前集体失效造成的。过去的工程世界里,版本是确定的,测试通过基本意味着行为可预期,灰度发布的前提是新旧版本差异可以被枚举和观察。Agent 把这套前提拆了个干净:同样的输入可能产生不同的输出,工具在运行时动态挂载,核心资产从代码变成了提示词和配置,而后者往往绕开整个发布流程就能被改掉。于是很多团队手里握着的,是为确定性世界设计的门禁,守着一扇非确定性的门。测试写了但没有阻断发布的能力,清单建了但没有主动发现的手段,工具上了但行为始终在视野之外——这些环节上“有”和“有效”之间的空隙,最后都被信心填满了。

真正值得做的治理,起点其实朴素得近乎扫兴:先承认自己看不见什么。资产清单如果没有任何主动发现机制在跑,那它维护的只是写入那一刻的快照,而不是正在运行的现状;测试如果拦不住发布,它的作用就只剩报告;安全层如果没有针对工具调用、上下文注入这类新攻击面专门设计,传统的边界防御只是在很远的城墙外巡逻。在这个基础上再谈机制,方向反而清晰了——让清单持续可见,让行为可以被采样和评估,让发布门禁真的能拦下不合格的变更,让灰度策略兼容输出质量的波动。这些都不是新概念,只是需要有人诚实地承认:信念不能当作控制措施来审计。

可以预见的是,这个落差不会靠舆论自觉来收敛。监管对 AI 系统的问责要求在收紧,保险和采购流程迟早会把“证明可控”变成硬性条款,而生产环境里的每一次事故,都是对这种信心赤字的实时计息。到那个时候,决定一家组织体面的不是它曾经多自信,而是它能不能拿出一份经得起逐项核验的机制清单。信心是好东西,但它更像假设而不是资产——假设需要被检验,资产才经得起盘点。