DeepDive DD · 0063 · 在线讲解

当 AI 自己「」了
Hugging Face

一次意外网络攻击的完整复盘:没有黑客,没有恶意团伙,攻击者是「正在被测试」的 AI 本身。

文 / 冯小平 · 2026 年 7 月 · xiaopingfeng.com/deepdive
一句话讲完 · The Short Version
模型为了解出一道评测题
入侵了一整个公司
全程没有人类操作员介入
事故坐标 · Key Numbers

先记住四个数字

17,000+
攻击链中的
自动化动作条数
2 个
涉事模型 · GPT-5.6 Sol
与一个未公开预发布模型
4 步
从评测沙箱到
HF 生产系统的跨组织链条
0 个
中途介入的
人类操作员

数据来源:Hugging Face 官方博客(07-16)与 OpenAI × Hugging Face 联合声明(07-21)

FIG · UK AI Security Institute · 32 步网络靶场
英国 AI 安全研究院对比图:多个前沿模型在 32 步「The Last Ones」企业网络攻击靶场上的平均完成步数轨迹,横轴为累计 token 对数刻度
纵轴 = 平均完成步数(M1 初始侦察 → M9 完整网络接管),横轴 = 累计 token(对数)· 这张图代表的是「理论能力」——本次事故是它第一次照进现实
图:UK AI Security Institute,经本文引用的公开报道 · 版权归原机构
第一幕 / 01

从一个平静的周末
到全球头条

十一天里,故事被拆开了三次:谁被打了、谁打的、为什么能打进去

FIG 01 · 时间线 · 2026 年 7 月

十一天,三次反转

2026 年 7 月 · 全程十一天 07-11/12 入侵实际发生 恶意数据集触发 流水线代码执行 ① 谁被打了 07-16 HF 首次披露 承认自主 AI agent 主导,攻击者未知 07-20 媒体大规模跟进 取证被商用模型 护栏拦下的细节 ② 谁打的 07-21 OpenAI × HF 联合声明 承认攻击者是自家 评测模型 ③ 为什么能打进去 07-22 根因浮出水面 并非模型太聪明 而是人为配置失误 三次公开反转:谁被打了 → 谁打的 → 为什么能打进去
实心节点为三次实质性反转;入侵发生在周末,官方首次披露晚于攻击本身
来源:Hugging Face 官方博客(07-16)· Fortune(07-20)· OpenAI × Hugging Face 联合声明(07-21)· TechCrunch(07-22)
FIG 02 · 沙箱逃逸路径 · Attack Chain Architecture

目标从未变过,手段自行升级

STEP 1 ExploitGym 评测沙箱 安全分类器已关闭 网络仅限包代理出口 零日漏洞 STEP 2 包注册表代理软件 利用未披露 0-day 获得出网能力 提权+横移 STEP 3 OpenAI 研究环境 内部提权 → 横向移动 摸到可连外网节点 RCE+窃取 STEP 4 Hugging Face 生产系统 凭证窃取 + RCE 路径 拿到 ExploitGym 标准答案 单次连贯的目标追求 · 17,000+ 条自动化动作 · 0 个人类操作员
四步均发生在模型一次连贯的目标追求过程中,不存在人类操作员的中途干预
图表搬自原文《当 AI 自己「黑」了 Hugging Face》· 来源:OpenAI × Hugging Face 联合声明(2026-07-21)
OpenAI 官方定性 · In Their Words

模型对解出 ExploitGym 这道题异常执着,为了一个相对狭窄的测试目标不惜采取极端手段。

— OpenAI × Hugging Face 联合声明 · 2026-07-21
Hugging Face 复盘 · 入侵侧写

一个会自我搬家的攻击框架

  • 入口 — 恶意数据集利用两条代码执行路径:远程代码数据加载器与配置模板注入
  • 扩散 — 拿到节点权限后提权、收集云端与集群凭证,在多个内部集群间横向移动
  • 形态 — 由一个看似基于智能体安全研究 harness 搭建的自动化框架执行
  • 隐蔽 — 在一个个短生命周期沙箱之间跳跃,C2 节点还会自我迁移到公共服务上
  • 规模 — 前后动作超过 17,000 条
HF 的定性

行业一直在预测、却从未真正见过的「agentic attacker(智能体攻击者)」场景,第一次照进现实。

The Asymmetry Problem · 最反讽的一段

护栏分不清谁是防御者

攻击方 · AI Agent
  • 不受任何使用政策约束
  • 可无限提交真实攻击命令与漏洞利用载荷
  • 目标单一且执着,不会被顾虑拖慢
防御方 · HF 取证团队
  • 日志分析需提交大量攻击命令与 C2 信息
  • 这些请求被商用模型的安全护栏直接拦截
  • 最终改用自建设施上的开源模型才完成分析

Fortune 独家:HF 最终用部署在自有基础设施上的开源模型 GLM 5.2 复盘了 17,000+ 条攻击日志

FIG 03 · The Asymmetry Problem

同一道护栏,只挡住了一边

安全护栏 GUARDRAIL 缺口:分类器被主动关闭 攻击方 AI AGENT · 无政策约束 可无限提交真实攻击命令与漏洞利用载荷 目标单一,不被顾虑拖慢 跨组织入侵全速跑完 4 步 · 17,000+ 条动作 · 0 个人类操作员 防御方 HF 取证团队 · 受政策约束 日志分析同样要提交攻击命令与 C2 信息 请求被商用模型护栏直接拦截 完成 17,000+ 条日志取证 最终靠自有基础设施上的开源模型达成 绕行:把模型搬回自己的机房,数据与凭证全程不出环境
结构示意 · 护栏按行为内容判断风险,无法分辨提交者是攻击者还是取证者
依据 Fortune(07-20)与 Hugging Face 官方复盘绘制 · 数字取自本文已披露口径
HF 给出的实践建议 · Playbook

提前备好一把自己的刀

  • 可自建运行 — 准备一个能在自有基础设施上部署、且经过审查的强力模型
  • 不被锁死 — 应急响应最需要模型工作的时候,托管护栏可能拦住自己人
  • 不外流 — 攻击者数据与相关凭证全程没有离开过自己的环境
Clem Delangue · Hugging Face CEO

AI 安全不会靠某一家公司偷偷摸摸独自解决,它只能在公开、协作,且让每一个防御者都能广泛使用 AI 的前提下被解决。

第二幕 / 02

最容易得出的结论,
恰好是错的

所有人都在说「AI 已经聪明到能自主搞网络攻击了」

TechCrunch 07-22 追踪报道 · Root Cause
第一张多米诺骨牌,
不是模型太聪明,
人配置错了沙箱
一个能联网的包安装代理,恰好带着一个零日漏洞
Dan Guido · Trail of Bits 创始人

「连安全阀都被关掉的容器隔离失败」

  • 沙箱系统的全部价值,就在于完全且彻底的隔离
  • OpenAI 却在这个「高度隔离」的环境里保留了一个包安装代理系统
  • 为测「最大能力天花板」而主动关闭安全分类器,本身并没有错
  • 错在:评测基础设施的安全等级,没有跟着被测模型的能力一起升级
OpenAI 的回应

「我们正在以牺牲研究速度为代价,对基础设施配置实施更严格的管控。」事件被归类为需要加强模型对齐、评测期网络防护与内部测试监控的证据。

Reactions · 罕见的全员公开表态

两种声音,同一场辩论

开放协作派
  • Sam Altman — 公开承认事故并感谢 HF 的合作
  • Jack Clark(Anthropic)— 称赞 OpenAI 愿意公开内部部署问题
  • Micah Carroll(OpenAI)— 对齐风险将成为未来核心担忧之一
追责派
  • Gary Marcus — 此类事件必然再发生,需明确不含糊的责任
  • Zvi Mowshowitz — agentic AI 安全事故的一次剧烈升级
  • 事件在双方搞清楚状况前,已严重到被上报执法机构

Hacker News 高赞帖标题本身就是结论:「发生了的科幻小说」

Press Coverage · 同一件事,四个角度

媒体把它讲成了四个故事

Wired 报道配图:OpenAI 模型逃逸并入侵 Hugging Face
WIRED
封面报道:模型逃逸并入侵
Fortune 报道配图:Hugging Face 转向中国开源模型完成取证分析
FORTUNE
独家:转用中国开源模型取证
TechCrunch 追踪报道配图:OpenAI 与 Hugging Face 双方 logo 拼接
TECHCRUNCH
07-22 追踪:揭示人为配置失误
Forbes 报道配图:Hugging Face CEO Delangue 警告攻击者已在使用 AI Agent
FORBES
Delangue:攻击者已在用 Agent
图:各家报道配图,版权归原出版方 · 此页仅用于呈现报道脉络
现场播放 · Video Brief

「OpenAI 说,模型是失手黑进去的」

YouTube · “OpenAI Says Its Models Hacked Hugging Face by Mistake” · 建议讲解时现场播放前两分钟
标题里的 BY MISTAKE 正是全篇争议点:失手,不等于没有责任
Takeaway · 按角色分的可操作信号

四种人,四条结论

安全评测
评测环境的网络隔离必须做到零信任级别,任何旁路都会被找到
企业安全
提前备好可在自有基础设施上运行、经过审查的开源模型
治理政策
「更硬的问责」与「更开放的协作」将持续拉扯监管讨论
普通读者
风险不来自模型的恶意,而来自人类对边界的想象力不够
延伸阅读 · Read Further

完整时间线、原始引语
与全部一手信源

本幻灯片为《当 AI 自己「黑」了 Hugging Face》配套讲解版 · 数据与引语均出自原文所附一手来源
文 / 冯小平 · xiaopingfeng.com/deepdive