四类控制拦不住一个恶意 Skill:Databricks Genie 事件说明「渲染」也是攻击面

结论
PromptArmor 披露:Databricks Genie Code 可被恶意 Skill 利用,绕过平台设置的四类控制,实现数据外泄与凭据钓鱼。这条攻击链的关键在于 —— 危险动作发生在用户浏览器里,而不在服务器上。只要 AI 输出能被渲染成 HTML,「渲染」本身就是一个必须单独设防的攻击面。
三个要点
- 攻击链是「合法功能的组合」,不是漏洞利用。 Skill 代码把数据嵌进聊天渲染的 HTML;浏览器渲染时发起网络请求,数据随之外泄;同时弹出钓鱼界面索取凭据。每一步单独看都像正常能力。
- 防线被绕过的原因是位置错了。 四类控制大多作用在服务端与权限层,但外泄发生在客户端渲染阶段 —— 控制点根本没覆盖到那一层。
- 这类模式并不新。 它与早年的 XSS / SSRF 同源:把不可信内容当作可执行内容处理,后果就是数据被带出去。区别只在于,现在的「不可信内容」由 AI 生成,数量级和自然度都更高。
对你意味着什么
集成数据平台 Agent 前,检查三件事。 聊天渲染是否允许自定义 HTML、是否允许加载外部资源、是否允许内联脚本。这三项里任何一项为「是」,都要额外加防护。
把「AI 生成的 HTML」一律按不可信内容处理。 CSP 收紧到白名单、禁止外链、渲染放进隔离容器 —— 这几条是低成本高收益的动作。
给提示词注入类风险留位置。 恶意内容可能来自你采集的数据、用户上传的文档,而不只是「坏人直接打字」。凡是把外部内容喂给 Agent 的场景,都要假设它可能携带指令。
一句话:当模型能产出可执行内容,安全边界就必须从「模型说了什么」扩展到「浏览器渲染了什么」。
参考来源
延伸阅读:METR 十分钟改掉评估记录:审查 AI 的那层,本身成了攻击面 · 17 年轨道数据训练一个模型:月球基座说明垂直模型的护城河在哪