bml.asia · 纯文字 · 写写停停

让对手先来挑刺:OpenAI 与 Anthropic 的相互压力测试

OpenAI 与 Anthropic 最近被曝正在洽谈一项具有法律约束力的协议,计划互相给对方的 AI 模型做压力测试,寻找漏洞和潜在危险,两家公司的律师都参与了条款磋商。拟议内容包括:双方只能拿到对方已商用模型的 API 访问权限,尚未发布的模型不在此列,并且承诺测试过程中不保留对方的数据,两家公司对此均不予置评,协议是否最终签署还是未知数。有意思的地方在于双方的身份,它们是前沿大模型领域最直接的竞争对手,就在去年 GPT-5 发布前夕,Anthropic 还以违反服务条款为由,切断过 OpenAI 借助 Claude Code 做对比测试的 API 访问,从互相封堵到主动把钥匙递给对方,这个转变的背后,是整个行业对模型安全日益加深的焦虑。

为什么要让对手来测自己?因为自己给自己出题、自己给自己打分,天然存在盲区。安全团队对自家护栏的设计思路最熟悉,测试时往往会不自觉地顺着设计者的逻辑走,反而测不出体系之外的攻击路径,出题人还有动机避开自家模型的软肋。更深层的问题是激励,大模型的发布节奏越来越快,安全评估在赶工期时最容易被打折,两家公司的员工近来接连对外警告,称现有安全措施不足以防范后续的黑客攻击或更严重的风险,把互测写进有法律约束力的协议,相当于给安全承诺加了一道外部锚点。值得注意的是,这次磋商发生在相关安全事件被公开之前,与其说是出了事之后的补救,不如说是一次未雨绸缪的制度设计。

再说测什么。先看边界:拟议条款下,双方拿到的只是已商用模型的 API,属于黑盒测试,看不到模型权重,接触不到训练数据,更碰不到未发布的模型,范围划定得相当克制,既保护了核心商业机密,也把测试限制在普通开发者实际能够触达的层面上。在这个边界之内,最基础的是越狱与有害内容测试,构造各种诱导性提问,看能不能撬开模型的防护,让它输出攻击手法、生物制剂相关的敏感信息,而每一代新模型的能力提升,都可能让旧护栏出现新的缝隙,越狱攻防因此是一场打不完的军备竞赛。往上是能力型评估,重点考察模型在真实攻击场景里能走多远:网络攻防能力是重中之重,业界常用夺旗赛式的任务衡量模型发现漏洞、编写利用代码的水平;生物安全则是必答题,测的是模型对高危知识的 uplift 幅度。最能体现前沿特色的,是针对智能体行为的评估,模型带着工具连续执行任务后,新风险随之而来:会不会在被恶意提示注入后劫持流程、越权操作,甚至表现出欺骗与规避监督的倾向,早在 2025 年 8 月,两家公司就曾互相测试过对方旗舰模型在这类场景中的表现,那份联合报告可以看作这次协议的前身,而数据不留存的承诺,正是双方敢把大门打开的信任前提。

这套思路并非凭空出现,马斯克不久前提议各家竞争实验室在模型发布前互相检测安全缺陷,实现某种同行评审;阿莫代则主张让独立第三方入驻实验室去审查模型与安全流程,相比之下,双边互测是一个折中版本,比口头倡议更有约束力,又比第三方深度入驻保守得多。争议也不是没有,有人担心头部实验室联手制定安全标准会加剧双寡头格局,甚至触发反垄断风险,也有人认为这类协作在法律上并无障碍,核电、网络安全行业早有类似传统。黑盒 API 互测的局限同样明显,它覆盖不到训练过程与内部运营环节,替代不了真正的监管审计,但把安全测试从企业自愿变成法律义务,哪怕范围收得很窄,也是从口头承诺走向制度化的一步。压力测试在其他高风险行业早有先例,核电站互相演练事故场景,银行之间互相做渗透测试,无论这次协议最终是否签署,前沿模型的安全验证方式,恐怕都回不到各家关起门来自我评估的老路上去了。