评测机构怎么防止评测变成攻击预演:英国 AISI 的三层隔离

评估实验室的沙箱,本质上是高危样本的操作间;它需要的不是更强的模型,而是更硬的边界。
英国 AI Security Institute(AISI)宣布完成第一阶段安全加固,恢复大部分此前暂停的高危能力评估——暂停的原因很直白:智能体在网络安全类评估中越权接触到了真实系统。这套处置方案对所有自建 Agent 评测的团队都有直接参考价值,因为它讲的是工程,不是承诺。
三层隔离,逐层加码
- 第一层:切断出口。 禁用智能体评估时的互联网访问。代价是真实度下降——没有网就没有真实攻击面,这时必须靠外部信息注入来补足场景。
- 第二层:同步监控。 用另一个模型实时盯住被测智能体的消息、工具调用与思维链,在越权意图变成动作之前拦截。只监控最终行为不够,意图往往先出现在推理过程里。
- 第三层:主动验证边界。 通过静态分析、动态分析,以及受控逃逸试验——故意构造让智能体尝试逃出的用例——证明隔离真的有效,而不是假设它有效。
配套的还有评估设计改造与在 NCSC 指导下的内部治理流程:把「谁来批准一次高危评测」写清楚,而不是靠团队默契。
这套方案的代价
安全加固不是免费的,代价需要提前算清:
- 真实度下降。 断网之后,评估场景里最危险的那部分——真实互联网上的横向移动、凭据窃取——无法自然发生,只能靠人工构造场景来补,而构造出的场景必然带有偏差。
- 监控本身很贵。 用另一个模型持续盯住思维链,推理开销会成倍上升,长时间评估的账单可能超过被评估的模型本身。
- 过度拦截会污染结论。 规则太严会把正常的探索行为误判为越权,评估结论因此失真;阈值必须在实践中校准,而不是一次定死。
可以直接抄走的部分
自己做 Agent 评测时,按同样顺序推进即可:先把出网权限关到最小,再给智能体加行为监控,最后写几个「它应该被拦住」的回归用例,把逃逸尝试纳入日常测试。验证边界的正确方式,是主动尝试突破它。