蒸馏攻击被公开处置:模型被偷的不是权重,是推理过程

多数人以为模型被盗指的是权重泄露。这次事件说明,更常见的攻击面其实是推理过程本身。
OpenAI 披露:已识别并处置一起有组织的模型蒸馏行动,目标是系统性提取模型受保护的推理内容,最早活动出现在 7 月第一周。
为什么「偷推理」比「偷权重」更现实
- 权重在服务器上,推理结果在 API 里。攻击者不需要接触任何机房,只要有账号和足够的调用预算,就能拿到海量「问题—高质量解答」样本。
- 蒸馏的产出可直接用于训练。用强模型输出喂小模型是标准蒸馏流程,区别只在于授权与否。
- 成本不对称:防御方要支付全部预训练成本,攻击方主要支付查询成本,中间差着数量级。这正是这类行动的经济动机。
防御为什么难
- 要和正常用户区分。批量蒸馏在流量上接近「重度用户」,用频率阈值会大量误伤合规客户。
- 要区分「问得刁钻」与「恶意提取」。前者是产品价值,后者是资产流失,边界由意图而非行为决定。
- 处置是持续的。封号之后对方换个账号重来,真正的收益来自让提取变得「性价比低」——例如限制结构化输出的完整度、加入可追溯标记。
对读者的实际影响
- 调用大模型做产品:你的调用日志本身就是资产,也是风险点。别把 key 放前端,给每个下游分配独立配额与告警。
- 自研模型:防蒸馏不是一次性风控,而要当成持续运营,和反爬是同一类问题。
- 普通使用者:这条新闻的实际意义是——你依赖的模型服务,未来可能在回答完整度上更保守,这是安全与体验之间被动的再平衡。
结论:模型资产保护的重点,正在从「守住权重文件」转向「管理好每一次推理输出」。