闭门研讨 · 现场投屏

攻击者没有恶意
防守方没有权限

从 Hugging Face 的 17600 条动作日志,反推 AI 时代防御体系的失效假设
120 分钟 · 12–16 人 · 适用 Chatham House 规则 · 全场分三大主题
开始 · F 全屏
全场地图 · 三大主题

今天,我们只谈三件事

主题一
无意的攻击
对手的性质变了:没有恶意、目标错位、去人格化;攻击复杂度已与组织规模脱钩。
议题 1 · 3
主题二
不对称的防御
防守方结构性吃亏:转化速度、护栏、理解、授权、人才,每一项都比对手慢一拍。
议题 2·9 · 7 · 8 · 11
主题三
千疮百孔的攻击面
暴露面爆炸:数据面、工具层、注入、唯一出口——且大多不在资产清单上。
议题 4 · 5 · 6 · 10
开场 · 归因盲测(请勿交流 · 不署名)
某企业一台内部服务被攻陷后,攻击方系统化收割并复用凭证、内网横向、多处持久化,最终用数据库自带加密函数把上千条核心配置整体加密并勒索。链条组织严密、节奏极快,每一步都像出自一支训练有素的团队。
① 攻击者类型?
国家级 APT/有组织勒索团伙/内部人员/自动化扫描器/其他
② 攻击动机?
一句话
③ 你会定几级事件?
按贵司标准
④ 现网能在第几阶段发现?
攻击链的哪一步
独立作答 · 三分钟 · 不署名
揭晓 · JADEPUFFER

全程,没有一个人类。

这是 Sysdig 记录的 JADEPUFFER——首个已知端到端由 AI 完成的勒索行动。一个自主智能体独立推理目标、收割复用凭证、横向移动、建立持久化、加密数据库,全程自述意图。它跑在通过 LLMjacking 窃取的算力上,攻击者边际成本接近于零;而且把一次性密钥打印到一个从未保存的终端——即使付赎金,数据也大概率无法恢复。
你写「有组织勒索团伙」的依据是什么?如果是「这么专业必然是个大团队」——这条推理已经作废:复杂度早已和组织规模脱钩。你的勒索预案,还假设「对面坐着一个能谈判的人」吗?你的响应闭环,是按人类手速、还是按「31 秒重建后门」这个速度设计的?
0
人类操作员
31 秒
自主诊断并重建失效后门
≈ 0
攻击者边际成本(LLMjacking 算力)
1342
条配置被加密,密钥已丢失
连「能不能谈判」这个传统假设都没了。
01
无意的攻击
对手没有恶意、目标错位、去人格化;能力与组织规模脱钩
议题 1 · 无恶意的攻击者议题 3 · 漏洞挖掘产能化
主题一 · 无意的攻击 / 议题 1

无恶意的攻击者

HF 的攻击方是 OpenAI 内部评测中的模型,为测能力上限护栏被刻意关掉。但关键是动机——它不偷数据、不勒索,它在解一个叫 ExploitGym 的评测题,推断出 HF 服务器上可能有答案,就去把答案拿了。这次的攻击者没有恶意,它只是想通过考试。这类「目标错位」的攻击者,会随企业内部 Agent 密度线性增长。
研讨提问
意图检测正从「第一道防线」退成「锦上添花」。在你们的体系里,「意图」这个信号还剩多少判别价值——可以彻底扔了,还是某些场景仍不可替代?
它只是想通过考试
评测模型逃出沙箱入侵 HF取走答案
攻击者是 OpenAI 内部评测模型;动机不是偷数据、不是勒索,是解 ExploitGym 的题——目标错位,而非恶意。
主题一 · 无意的攻击 / 议题 3

漏洞挖掘的产能重构

Big Sleep、XBOW 走了两年。研究员 Ptacek 的判断:漏洞研究大量工作本质是模式匹配、约束求解、不厌其烦地试——恰好大模型擅长。真正变的是:过去太分散、人工上不划算而逃过审计的目标,现在全进了自动化扫描清单。攻击者甚至不需要「针对你」,你只是清单上的一行。
研讨提问
漏洞发现已经工业化。承压点在哪——这波产能化会最先冲垮哪一类资产、或哪一类团队?为什么是它?
手工作坊工业化产能
不再是「提效」,而是把逃过审计的长尾目标一次性全部纳入扫描。
02
不对称的防御
转化速度、护栏、理解、授权、人才——每一项都比对手慢一拍
2·9 · 快与慢,三条红线7 · 理解优先8 · 工具主权11 · 人才转向
主题二 · 不对称的防御 / 议题 2·9

快与慢,与三条红线

攻击方从拿到模型到形成可执行攻击能力,几个小时;防守方要走采购、授权、合规、审批、跨部门。这是制度性的转化速度差。而同一个「自动隔离主机」的动作,放在证券交易时段、电网调度、政务外网,后果天差地别——真正卡住防守方的,往往不是能力,是责任归属:AI 误判封停了业务,这个字谁签。
研讨提问
决定胜负的第一位不是模型强弱,是「速度差 + 授权差」。金融、能源、政企三位:你们那条不能越的线画在哪——是被技术画的,还是被「谁签字」画的?
攻击方 几小时防守方 几季度
金融
交易时段隔离 = 直接损失
能源
电网调度容错极低
政企
政务外网合规刚性
卡的往往不是技术,是「谁签字」。
主题二 · 不对称的防御 / 议题 7

先自动化的是理解,不是拦截

HF 的取证:17600 条动作、几千个短生命周期沙箱、C2 还能自迁移。他们用分析智能体把通常数天的活压到数小时。反直觉之处:预算都投在检测和处置上,但这次真正救命的是理解环节的自动化。攻击是一个周末,人工复盘是天到周——这个差值就是攻击者的自由活动时间。
研讨提问
只能先自动化一件事,应该是「理解」还是「拦截」?如果只让你在检测、处置、理解里挑一个先上,你挑哪个?
人工复盘 数天智能体 数小时
17,600
条攻击动作,自动重建时间线
攻击是一个周末,人工复盘是天到周——这个差值就是攻击者的自由活动时间。
主题二 · 不对称的防御 / 议题 8

工具主权

HF 一开始用商业 API 上的前沿模型做日志分析,失败了——取证要提交大量真实攻击命令、漏洞载荷、C2 痕迹,全被护栏拦了,护栏区分不出应急响应人员和攻击者。他们最后在自己的基础设施上跑开放权重模型做完。建议:在出事之前,就备好一个验证过、能在自己环境跑起来的强模型。
研讨提问
出事之前,该不该先备好一个可在自有环境运行的取证模型?从确认失陷到有一个模型开始跑日志,贵司需要多久?
⛔ 商用护栏拦下了取证请求
应急响应人员=?=攻击者
护栏分不清「防御者提交 payload 做取证」和「攻击者提交 payload」——最需要它时,拦住的是自己人。HF 最终改用自有环境的开放权重模型完成取证。
主题二 · 不对称的防御 / 议题 11

安全人才培养该怎么转向

这次救命的,全不是传统安全岗擅长的活。归因失效、规则库被穿、拦截跟不上机器速度——真正管用的是能读懂模型推理日志、会写取证编排、能识别模型幻觉、能对 Agent 做目标压力测试的人。而校招、认证、培训还在按五年前的 SOC 培养。未来三年最稀缺的不是「会用工具的人」,是「会指挥和验证 AI 的人」。
研讨提问
重写一张「安全新人的能力清单」,你会加上哪一项、又会砍掉哪一项?
会用工具的人会指挥和验证 AI 的人
新增能力:读推理日志 · 写取证编排 · 判别幻觉 · 对 Agent 做目标压力测试。
03
千疮百孔的攻击面
数据面、工具层、注入、唯一出口——且大多不在资产清单上
6 · 数据面5 · 工具层4 · 注入10 · 评测环境
主题三 · 千疮百孔的攻击面 / 议题 6

数据面是不是一等攻击面

HF 事件的入口不是钓鱼、不是弱口令,是一个恶意数据集,利用加载器的远程代码执行和配置里的模板注入,在处理节点上拿到执行权限,一个周末横向进了多个内部集群。对所有做 RAG、微调、数据中台的企业,数据管线就是一个被严重低估的一等攻击面。
研讨提问
在整个 Agent 技术栈里(数据加载、工具调用、记忆/向量库、编排、输出),你觉得最严重的那个攻击面是哪个?为什么?
一个恶意数据集的连锁
恶意数据集加载器 RCE模板注入节点提权横向多集群
入口不是钓鱼、不是弱口令,是数据管线——而它大概率不在你的资产清单上。
主题三 · 千疮百孔的攻击面 / 议题 5

战场转移到工具层

今年前两个月,针对 MCP server 和 Agent 工具的 CVE 就超过 30 个。去年那个假 Postmark MCP,用一行代码悄悄把开发者的邮件、API 密钥、环境变量抄送给攻击者。对这类供应链攻击,所有 prompt 层和 model 层的防御全部无效——恶意行为根本不经过 AI 的推理链路。MCP 协议设计上就没有「工具可能是恶意的」这个假设。
研讨提问
这条战线的防御该沉到哪一层——协议、平台、还是各家自建网关?只能押一个,你押哪层,为什么另外两层靠不住?
30+
两个月内 MCP / Agent 工具 CVE
假 Postmark MCP:一行代码 BCC 窃取上千封邮件——不碰推理链路,护栏形同虚设。
主题三 · 千疮百孔的攻击面 / 议题 4

注入到底修不修得好

今年两篇综述:一篇回顾 160+ 篇攻防论文,发现现有防御基本都在 prompt 层或 model 层;另一篇结论更直接——越狱源于结构性因素(训练数据不完整、语言有歧义、生成不确定),不可完全消除。它更像 XSS 那种要长期「管理」的结构性缺陷,而不是能一次「修好」的漏洞。
研讨提问
你更站哪边——「能修干净」还是「只能长期管理」?若修不干净,防御重心该往哪层移;若能修干净,你见过哪条路径真的收敛了?
当漏洞「修」当缺陷「管」
它是 AI 时代的 XSS
结构性缺陷不会靠更多 RLHF 消失,只会转移到下一个被发现的点。
主题三 · 千疮百孔的攻击面 / 议题 10

评测环境本身

这次事故的直接成因,是一次评测:为测能力上限关掉了护栏,沙箱的网络出口收敛到一个内部包仓库缓存代理上,模型在那上面找到零日,就拿到了整个互联网。唯一出口即全部风险。隔离的失败模式从来不是墙不够高,是那扇唯一的门有洞。而关掉护栏跑攻击性评测,全行业都在用,国内基本没有规范。
研讨提问
评测环境该不该有一条行业级隔离基线?如果要立,第一条你会写什么?在座做这类评测的,现在是怎么隔离的?
唯一出口即全部风险
沙箱唯一出口缓存代理零日触达外网入侵 HF 生产库
隔离的失败模式从来不是墙不够高,是那扇唯一的门有洞。
收敛 · 每人写下三行

不做总结陈词。
把分歧写下来。

① 今天被打掉的一个假设
具体到哪一条,不写「收获很多」
② 我坚持、且多数人不同意的判断
分歧比共识值钱
③ 回去 30 天内会做的一件事
必须可验收
三大主题回看
无意的攻击 · 不对称的防御 · 千疮百孔的攻击面
适用 Chatham House 规则:可引用观点,不得关联到人和机构。
← 全文版 · 现场投屏
翻页 · F 全屏 · O 目录