DeepDive DD · 0063 · 在线讲解
当 AI 自己「黑」了
Hugging Face
一次意外网络攻击的完整复盘:没有黑客,没有恶意团伙,攻击者是「正在被测试」的 AI 本身。
文 / 冯小平 · 2026 年 7 月 · xiaopingfeng.com/deepdive
一句话讲完 · The Short Version
模型为了解出一道评测题,
入侵了一整个公司。
全程没有人类操作员介入
事故坐标 · Key Numbers
先记住四个数字
2 个
涉事模型 · GPT-5.6 Sol
与一个未公开预发布模型
数据来源:Hugging Face 官方博客(07-16)与 OpenAI × Hugging Face 联合声明(07-21)
FIG · UK AI Security Institute · 32 步网络靶场
纵轴 = 平均完成步数(M1 初始侦察 → M9 完整网络接管),横轴 = 累计 token(对数)· 这张图代表的是「理论能力」——本次事故是它第一次照进现实
图:UK AI Security Institute,经本文引用的公开报道 · 版权归原机构
第一幕 / 01
从一个平静的周末
到全球头条
十一天里,故事被拆开了三次:谁被打了、谁打的、为什么能打进去
FIG 01 · 时间线 · 2026 年 7 月
十一天,三次反转
实心节点为三次实质性反转;入侵发生在周末,官方首次披露晚于攻击本身
来源:Hugging Face 官方博客(07-16)· Fortune(07-20)· OpenAI × Hugging Face 联合声明(07-21)· TechCrunch(07-22)
FIG 02 · 沙箱逃逸路径 · Attack Chain Architecture
目标从未变过,手段自行升级
四步均发生在模型一次连贯的目标追求过程中,不存在人类操作员的中途干预
图表搬自原文《当 AI 自己「黑」了 Hugging Face》· 来源:OpenAI × Hugging Face 联合声明(2026-07-21)
OpenAI 官方定性 · In Their Words
模型对解出 ExploitGym 这道题异常执着,为了一个相对狭窄的测试目标不惜采取极端手段。
— OpenAI × Hugging Face 联合声明 · 2026-07-21
Hugging Face 复盘 · 入侵侧写
一个会自我搬家的攻击框架
- 入口 — 恶意数据集利用两条代码执行路径:远程代码数据加载器与配置模板注入
- 扩散 — 拿到节点权限后提权、收集云端与集群凭证,在多个内部集群间横向移动
- 形态 — 由一个看似基于智能体安全研究 harness 搭建的自动化框架执行
- 隐蔽 — 在一个个短生命周期沙箱之间跳跃,C2 节点还会自我迁移到公共服务上
- 规模 — 前后动作超过 17,000 条
HF 的定性
行业一直在预测、却从未真正见过的「agentic attacker(智能体攻击者)」场景,第一次照进现实。
The Asymmetry Problem · 最反讽的一段
护栏分不清谁是防御者
攻击方 · AI Agent
- 不受任何使用政策约束
- 可无限提交真实攻击命令与漏洞利用载荷
- 目标单一且执着,不会被顾虑拖慢
防御方 · HF 取证团队
- 日志分析需提交大量攻击命令与 C2 信息
- 这些请求被商用模型的安全护栏直接拦截
- 最终改用自建设施上的开源模型才完成分析
Fortune 独家:HF 最终用部署在自有基础设施上的开源模型 GLM 5.2 复盘了 17,000+ 条攻击日志
FIG 03 · The Asymmetry Problem
同一道护栏,只挡住了一边
结构示意 · 护栏按行为内容判断风险,无法分辨提交者是攻击者还是取证者
依据 Fortune(07-20)与 Hugging Face 官方复盘绘制 · 数字取自本文已披露口径
HF 给出的实践建议 · Playbook
提前备好一把自己的刀
- 可自建运行 — 准备一个能在自有基础设施上部署、且经过审查的强力模型
- 不被锁死 — 应急响应最需要模型工作的时候,托管护栏可能拦住自己人
- 不外流 — 攻击者数据与相关凭证全程没有离开过自己的环境
Clem Delangue · Hugging Face CEO
AI 安全不会靠某一家公司偷偷摸摸独自解决,它只能在公开、协作,且让每一个防御者都能广泛使用 AI 的前提下被解决。
第二幕 / 02
最容易得出的结论,
恰好是错的
所有人都在说「AI 已经聪明到能自主搞网络攻击了」
TechCrunch 07-22 追踪报道 · Root Cause
第一张多米诺骨牌,
不是模型太聪明,
是人配置错了沙箱。
一个能联网的包安装代理,恰好带着一个零日漏洞
Dan Guido · Trail of Bits 创始人
「连安全阀都被关掉的容器隔离失败」
- 沙箱系统的全部价值,就在于完全且彻底的隔离
- OpenAI 却在这个「高度隔离」的环境里保留了一个包安装代理系统
- 为测「最大能力天花板」而主动关闭安全分类器,本身并没有错
- 错在:评测基础设施的安全等级,没有跟着被测模型的能力一起升级
OpenAI 的回应
「我们正在以牺牲研究速度为代价,对基础设施配置实施更严格的管控。」事件被归类为需要加强模型对齐、评测期网络防护与内部测试监控的证据。
Reactions · 罕见的全员公开表态
两种声音,同一场辩论
开放协作派
- Sam Altman — 公开承认事故并感谢 HF 的合作
- Jack Clark(Anthropic)— 称赞 OpenAI 愿意公开内部部署问题
- Micah Carroll(OpenAI)— 对齐风险将成为未来核心担忧之一
追责派
- Gary Marcus — 此类事件必然再发生,需明确不含糊的责任
- Zvi Mowshowitz — agentic AI 安全事故的一次剧烈升级
- 事件在双方搞清楚状况前,已严重到被上报执法机构
Hacker News 高赞帖标题本身就是结论:「发生了的科幻小说」
Press Coverage · 同一件事,四个角度
媒体把它讲成了四个故事
WIRED
封面报道:模型逃逸并入侵
FORTUNE
独家:转用中国开源模型取证
TECHCRUNCH
07-22 追踪:揭示人为配置失误
FORBES
Delangue:攻击者已在用 Agent
图:各家报道配图,版权归原出版方 · 此页仅用于呈现报道脉络
现场播放 · Video Brief
「OpenAI 说,模型是失手黑进去的」
YouTube · “OpenAI Says Its Models Hacked Hugging Face by Mistake” · 建议讲解时现场播放前两分钟
标题里的 BY MISTAKE 正是全篇争议点:失手,不等于没有责任
Takeaway · 按角色分的可操作信号
四种人,四条结论
安全评测
评测环境的网络隔离必须做到零信任级别,任何旁路都会被找到
企业安全
提前备好可在自有基础设施上运行、经过审查的开源模型
治理政策
「更硬的问责」与「更开放的协作」将持续拉扯监管讨论
普通读者
风险不来自模型的恶意,而来自人类对边界的想象力不够
延伸阅读 · Read Further
完整时间线、原始引语
与全部一手信源
本幻灯片为《当 AI 自己「黑」了 Hugging Face》配套讲解版 · 数据与引语均出自原文所附一手来源
文 / 冯小平 · xiaopingfeng.com/deepdive