bml.asia · 纯文字 · 写写停停

蒸馏之争:学生读老师的书,怎么就成了罪名

“恶意蒸馏”,第一次看到这个词,还以为是哪篇安全论文里的新概念,点进去才发现是 9 月 8 日美国国家安全局、网络安全和基础设施安全局加上联邦调查局的联合公告,指控中国 AI 企业对美国的前沿大模型进行所谓“恶意蒸馏”。我盯着它看了好几秒,心里只有说不出的荒诞感。在深度学习的教科书里,知识蒸馏是个再普通不过的名词:大模型当老师,小模型当学生,学生从老师的输出里学到压缩过的知识,好让模型能在手机和各类边缘设备上跑起来。这套方法由 Hinton 等人在 2015 年系统提出,十年来支撑了无数端侧模型的落地,算力不够,就用知识来凑,这是整个行业心照不宣的基本功。大概没有谁想过,有朝一日“学生读老师的书”会被写进国家安全公告,变成一项罪名。

把时间线摊开看,这场从技术到政治的演进相当连贯。最先动起来的是 OpenAI 和 Anthropic,两家在 2 月先后向国会提交材料、发布指控;进入 4 月,白宫科技政策办公室抛出防范“对抗性蒸馏”的备忘录;到了 6 月,白宫一边要求安全部门与私企展开合作,一边收到 Anthropic 写给参议院的信;7 月 22 日,黄仁勋公开表态支持蒸馏技术,两天后英伟达、微软等巨头连同 Meta 与 IBM,一共 25 家机构联名发声,给这项技术撑腰;到了 9 月 8 日,公告还是落地了。半年多时间,一项中性技术被一层层包装成了安全威胁,节奏之快、配合之默契,很难让人相信这只是巧合。

更值得玩味的是公告的证据链条。它的依据主要是个别企业的自述报告,线索不过是 IP 地址之类的间接痕迹,而逻辑断裂处一眼就能看出来:拿到了数据不等于用来训练了模型,何况模型本身是个黑盒,谁也没法从一堆权重里反推出训练数据的样子。拿间接线索给人定罪,放到哪里都说不过去。而且蒸馏这件事从来都是双向的,英伟达自家的 Nemotron 用 DeepSeek-R1 生成训练样本,搜索引擎公司 Perplexity 则基于 R1-1776 做微调,这些美国公司同样在大量蒸馏中国模型。要是按公告的逻辑较真下去,第一份该被调查的名单恐怕得从硅谷开始。

双标的戏码在历史里其实演过不止一次。回看 1984 年,美国通过《半导体芯片保护法》保护芯片布局设计,那时它是追赶者,主张的是学习与借鉴的自由;到了 2021 年,谷歌诉甲骨文案里,美国最高法院裁定谷歌复制 Java 接口构成合理使用,护的还是后来者的生存空间,彼时的判词里写满对知识流动的宽容。如今角色一换,当年的道理就不再作数,前沿模型周围要修起“数据护城河”,别人的进步则被定义为恶意。信通院那位作者说得直白,蒸馏之争争的不是技术安全,而是智能时代的发展权。我读到这句话时停了一下,觉得这是整场争论里最接近本质的一句判断。

写到这里,我其实不太想继续纠缠谁对谁错。技术本身没有立场,蒸馏也好,开源也好,本质上都是知识流动的方式,而墙一旦修起来,最先被挡住的是所有人共享的进步速度。何况现在手机上跑得动的那些小模型,很多正是靠蒸馏才走进日常生活的,从离线翻译到端侧语音识别,受益的是每一个普通人。文章最后提的路径我挺认同,中美在 2024 年 5 月就在日内瓦有过首次 AI 政府间对话,安全测试、伦理标准、医疗应用,这些领域都值得坐下来谈。希望这场蒸馏之争最终能回到技术的桌上,而不是停在公告的措辞里。毕竟学生的天职就是读老师的书、站在老师的肩膀上,这件事要是成了罪名,受伤的不会只是哪一家公司。