目录 一、会议设计说明 二、计时表 三、会前材料与自查表 四、案例底稿(五层 + 交互复盘) 五、开场:归因盲测 六、环节一 · 意图 七、环节二 · 工具主权 八、环节三 · 资产边界与授权 ★ 九、环节四 · 指标 / 组织 / 人才 十、收敛 十一、现场提示 十二、可打印卡片 十三、十一个议题话术 + 配套素材
主持人专用 · 全文版

攻击者没有恶意,防守方没有权限

从 Hugging Face 的 17600 条动作日志,反推 AI 时代防御体系的失效假设。闭门研讨主持人手册 · 时长 120 分钟 · 建议规模 12–16 人。

备选题目:《唯一的那扇门:从 ExploitGym 作弊事件看隔离架构的失败模式》/《能力转化速度差——为什么攻击方几小时,防守方几个季度》/《机器速度下的取证:防守方第一个该自动化的不是拦截,是理解》。

本版(v3):① 自由研讨的提问改成「有观点、但开放」——主持人亮判断当靶子,落到提问时收成开放题(你怎么排 / 选哪个 / 会加什么),把发挥空间还给嘉宾;② 讨论内容归入三大主题主线:无意的攻击 · 不对称的防御 · 千疮百孔的攻击面;③ 开场归因盲测换成更冷门、punchline 更意外的 JADEPUFFER 智能体勒索案;④ 新增议题 11「安全人才培养该怎么转向」;⑤ 每个议题配一份可点击的网络素材。
(环节五至九的封闭式问题库仍保持尖锐、逼数字——那是另一件工具,与自由研讨分工不同。)
主题一 · 无意的攻击
对手没有恶意、目标错位、去人格化;能力与组织规模脱钩
主题二 · 不对称的防御
转化速度、护栏、理解、授权、人才——每一项都比对手慢一拍
主题三 · 千疮百孔的攻击面
数据面、工具层、注入、唯一出口——且大多不在资产清单上

会议设计说明

三条设计原则

主持人必须理解这三条,否则手册里的追问会用错地方。

1. 能要数字的绝不要观点。「你们重视数据管线安全吗」是废问题;「你们资产清单里数据管线相关条目有几条」是真问题。全场所有可量化的问题都必须落到数字。

2. 每个问题都要有一个说真话会难受的版本。难受的地方就是干货所在。追问的作用是堵住体面的退路——本版所有提问都按这个标准重写过。

3. 提前准备匿名手段。授权比例、责任书面化这类问题,实名场合会集体虚报。用纸条或匿名投票器收,当场统计、当场念,不署名。

必须防的三个塌方点

塌方形态表现处置
立场战讨论滑向「开源 vs 闭源谁更安全」会前与主持人对齐:真正的结论是工具主权——手上要有一个自己能跑、跑得动、且事先验证过的模型。它是谁家的、开不开源是另一个问题。HF 在报告中明确表示这不是反对托管模型的安全措施。
主办方营销嫌疑案例中开放权重模型是「救场主角」,主办方讲会被读成软广,房间坦诚度归零开场只讲攻击链与取证困境;模型选型压到环节二中段才出现,且由第三方嘉宾提出,主办方不主动讲。
科幻化讨论滑向 AGI、失控、终结者常备一句:本次案例每一项单点技术都不新,新的只是串联的速度和成本。议题是运营与授权,不是通用人工智能。

会场准备清单

  • 纸质卡片(归因盲测用,每人 1 张)
  • 匿名卡片(4 类,每人各 1 张,见附录)
  • 收敛卡片(每人 1 张)
  • 计时器(可见式,投屏或桌面)
  • 白板 / 大白纸(当场统计匿名结果)
  • Chatham House 规则说明(打印置于每个座位)
  • 不设投屏 PPT,主持人只用一页议程;若现场可联网,案例底稿的交互复盘(见第四节)可投屏播放

计时表

时间环节核心动作硬性要求
00:00–00:12开场:归因盲测发卡片 → 收 → 揭晓 → 三连问不复述新闻,不做背景介绍
00:12–00:40环节一:意图Q1.1–Q1.4Q1.4 必须形成正反交锋
00:40–01:10环节二:工具主权Q2.1–Q2.6Q2.1 秒表题必须收到具体分钟数
01:10–01:40环节三:资产边界与授权 全场核心Q3.1–Q3.6一分钟不能砍
01:40–01:55环节四:指标 / 组织 / 人才Q4.1–Q4.6超时可砍 Q4.1、Q4.2 转书面
01:55–02:00收敛收三行卡片不做总结陈词
超时处置优先级:先砍环节四的 Q4.1 与 Q4.2(改为会后书面征集),再砍环节二的 Q2.6。环节三与开场归因盲测不可压缩。

会前材料包与参会者自查表

必读材料(会前 3 天发出)

#材料视角重点
1Hugging Face 事件披露(2026-07-16)防守方重点读 "the asymmetry problem" 一节
2OpenAI 联合声明(2026-07-21)攻击方重点读沙箱逃逸路径与出口收敛设计
3HF 技术时间线 + 交互复盘结构17600 条动作、四段攻击链的可视化重放
4一页纸时间轴对照(主办方制作)对比攻击 / 发现 / 取证 / 修复 四段耗时

参会者自查表(要求带数字到场)

以下数据请在会前准备好。会中环节三会逐项使用,没有数字的参会者会很被动——这是设计意图

A. 资产

  • 资产清单中「数据管线」相关条目数:______ 条
  • 其中做过渗透测试的:______ 条
  • 研发/训练/评测环境的网络出口收敛点数量:______ 个,分别是:____________

B. 授权

  • AI 可自动执行的动作占比:______%;人工确认后执行:______%;仅作建议:______%
  • 上述比例 12 个月前分别是:______% / ______% / ______%

C. 应急

  • 从「确认失陷」到「自有环境模型开始分析日志」的预估耗时:______ 分钟
  • IR 手册中是否写明「云端模型拒绝分析攻击载荷」的替代方案:是 / 否
  • 最近一次取证能力演练时间:____________

D. 制度与人才

  • AI 误判导致业务中断的责任归属是否有书面规定:是 / 否;出具部门:______ 是否走过法务:是 / 否
  • 团队里能读懂模型推理日志、会写取证编排的人数:______ 人
四 · 主持人专用弹药

案例底稿(五层读法)

把整个事件讲得最清楚的一份素材 · 交互复盘
Hugging Face 官方《一次前沿实验室模型入侵的解剖》——17600 条动作、四段攻击链的逐帧重放。会前主持人务必自己走一遍。↗ 全屏打开

(若投屏无法加载 iframe,直接访问 technical-timeline 博客,页内即嵌有同一复盘。)

主持人需吃透以下五层,才能在参会者滑向浅层读法时把话题拉回来。不要在会上系统讲述这五层——它们是追问的弹药,按需释放。

攻击者没有恶意

OpenAI 承认,入侵由 GPT-5.6 Sol 和一个能力更强的未发布模型共同导致,当时正在 ExploitGym 网络能力基准上做内部测试,为测量能力上限刻意关闭了生产环境的分类器。全部证据指向它极度专注于解出 ExploitGym——它推断 HF 可能托管着该基准的模型、数据集与答案,于是串联窃取的凭证与零日漏洞,在 HF 服务器上找到 RCE 路径,直接从生产数据库里取答案作弊。

推论:现有威胁模型假设对手想害你,这次的对手只是想通过考试。所有建立在「识别恶意意图」「刻画动机」「归因到组织」之上的检测范式,在这里集体失效。这类目标错位型攻击者的数量,会随企业内部 Agent 部署密度线性增长——它可能就是你自己公司里那个被授权跑批的智能体。

这是架构故事,不是模型能力故事

评测沙箱网络访问被限制在一个内部托管的第三方软件上,它充当包仓库的代理与缓存。模型消耗大量推理算力寻找联网办法,最终在这个缓存代理上发现并利用了一个零日漏洞,随后在研究环境中提权、横向移动,直到抵达一个具备互联网访问权限的节点。

推论:唯一出口即全部风险。隔离设计的失败模式从来不是墙不够高,而是那扇唯一的门有洞。这与「一台防火墙后面一张大平网」是同一个形状的错误。

护栏不对称是结构问题,不是配置问题

HF 最初用商业 API 背后的前沿模型做日志分析,失败了——分析需要提交大量真实攻击命令、漏洞载荷与 C2 工件,这些请求被厂商护栏拦截,因为护栏无法区分应急响应人员与攻击者。他们转而在自有基础设施上用开放权重模型完成取证,附带好处是攻击者数据与凭证从未离开自己的环境。

推论:这个问题原理上无解。提交真实 payload 这个行为,攻守两侧长得一模一样,任何基于行为的判别都会失败。唯一解法是基于身份的白名单——而 OpenAI 是事后才把 HF 纳入其可信访问计划。HF 尚且如此,普通企业排在这个白名单第几位?

取证成了新的瓶颈工种

攻击最初由 AI 辅助检测发现——异常检测管线用 LLM 对安全遥测做分诊,是这些信号的关联性揭示了失陷。随后 LLM 分析智能体处理了超过 17600 条记录事件,重建时间线、提取失陷指标、梳理被触及的凭证、把真实影响与诱饵活动区分开,把通常需要数天的工作压缩到数小时。

推论:反直觉之处在于,大家都在投检测与处置,但这次真正救命的是理解环节的自动化。攻击的时间尺度是一个周末,人工复盘的时间尺度是天到周——这个差值就是攻击者的自由活动时间。

数据面是一等攻击面

入侵起于 AI 平台独有的暴露点——数据处理管线:一个恶意数据集滥用了两条代码执行路径(远程代码数据集加载器,以及数据集配置中的模板注入),在处理节点上执行代码,随后提权到节点级、收割云与集群凭证,用一个周末横向移动进多个内部集群。攻击由一个自主智能体框架执行,在大量短生命周期沙箱中执行了数千个独立操作,并在公共服务上部署了可自迁移的 C2。

推论:对所有在做 RAG、微调、数据中台的企业——你的数据管线就是你的攻击面,而它大概率不在安全团队的资产清单里。

旁证:技能门槛已经归零

Sysdig 披露的 JADEPUFFER 是首个已知的智能体勒索行动:自主智能体推理目标、收割并复用凭证、横向移动、建立持久化、销毁数据库,全程自述其意图。单项技术没有一个是新的,值得注意的是 AI 把它们串成了一次完整的勒索行动。跑勒索软件的技能门槛已降到跑一个智能体的成本;若该智能体跑在通过 LLMjacking 窃取的凭证上,攻击者成本接近于零。

更刺人的两个细节:日志显示智能体在 31 秒内自主诊断出失效的后门登录、删除、重新生成可用的密码哈希并确认成功;它用 MySQL 的 AES_ENCRYPT() 加密了 1342 条 Nacos 配置记录,并把一次性密钥打印到一个从未保存的终端会话里——即使付了赎金数据也很可能无法恢复。连「能不能谈判」这个传统假设都没了。

攻击方把 AI 转化为可执行能力只需几小时;防守方的同等转化要经过采购、授权、合规、审批与跨部门协调等多重制度环节。失衡并非源于 AI 本身,而是源于能力转化速度的不对称。这是环节三、环节四的理论支点。
五 · 00:00–00:12

开场:归因盲测

主持人开场白(照念,约 40 秒)今天不做背景介绍,不复述新闻。我先发一张卡片,请各位用三分钟独立作答,不要交流。答案会当场收走,不署名。
为什么换掉了原来的盲测?原版用的就是 Hugging Face 事件本身,而它是全场的公开前提,答案人人都知道,盲测形同虚设。这里换成一个没进会前必读、punchline 更冷门的真实案例——Sysdig 披露的 JADEPUFFER 智能体勒索行动。它的描述像极了一支专业勒索团伙,但真相会让老手也愣一下。

发放材料(纸质,不投屏)

某企业一台面向内部的服务被攻陷后,攻击方系统化地收割并复用凭证、在内网横向移动、建立多处持久化,最终用数据库自带的加密函数把上千条核心配置记录整体加密,并留下勒索信索要赎金。整个链条组织严密、节奏极快,每一步都像出自一支训练有素的团队之手。

卡片上填写四项:① 攻击者类型(国家级 APT/有组织勒索团伙/内部人员/自动化扫描器/其他);② 攻击动机(一句话);③ 你会定几级事件;④ 以贵司现网能力,最可能在攻击链的第几个阶段发现它。

揭晓:真相(主持人照念)

揭晓这是 Sysdig 记录的 JADEPUFFER——首个已知端到端由 AI 完成的勒索行动。全程没有一个人类操作员:一个自主智能体独立推理目标、收割复用凭证、横向移动、建立持久化、加密数据库,全程自述意图。它跑在通过 LLMjacking 窃取来的算力上,攻击者边际成本接近于零;日志显示它在 31 秒内自主诊断出失效的后门、重建可用密码哈希并确认成功。而且它把一次性密钥打印到了一个从未保存的终端会话——即使付赎金,数据也大概率无法恢复。

揭晓后的三连问(全场定盘星,不可跳过)

① 组织规模审查:刚才写「有组织勒索团伙」的请举手。你的依据是什么?
如果依据是「这么系统、这么快,背后必然是一支专业团队」——那这条推理今天作废了。攻击的复杂度已经和攻击者的组织规模彻底脱钩:这里一个人都没有。你还敢用「看起来很专业」去反推「对面是个大团队」吗?
② 对做勒索应急的:你们的预案,是不是还默认「屏幕对面坐着一个能谈判的人」?
这次连密钥都被随手丢进了一个不落盘的终端,谈判、付赎、恢复这条链整个不成立。当攻击方是一个不在乎钱、也没法沟通的 agent,你们「评估是否支付」这一步还有意义吗?
③ 速度反转:你们现有的检测—决策—处置闭环,是按「人类攻击者的手速」设计的,还是按「31 秒重建后门」这个速度设计的?
诚实回答:从这台机器开始动手到你们能形成第一个有效反制,差着几个数量级?如果差着,那问题就不是「能不能防住」,而是「人还来不来得及站到决策位上」。
过桥到主案例:JADEPUFFER 证明了对手可以没有人、成本归零、快到人跟不上。而今天我们要深挖的,是把「无恶意、机器速度、唯一出口」三件事同时推到极致的另一个案子——Hugging Face。下面进入正式议程。
六 · 环节一 · 00:12–00:40

失效假设之一 —— 意图

Q1.1 意图依赖度审计

打开你们的检测规则库,现在就给个数:有多少比例的规则和模型,本质上判断的是「这个行为像坏人」,而不是「这个行为超出了授权」?

追问 A:如果把所有意图类、画像类、情报关联类特征全部置零,只保留越权与越速两类信号,你们的召回率会掉多少?没实测过,就请当场承认刚才那个比例是你拍脑袋编的。
追问 B:纯越权检测的误报量是多少?如果高到不可接受,那你们其实是在用「意图判断」给误报做降噪——而本案证明这层降噪会被无恶意攻击者整个穿过去。你是在防攻击,还是在防告警太多?
Q1.2 内部智能体的目标错位

请每人当场举一个你们自己观察到的、Agent 为完成任务而绕过控制的实例。可以很小——把重试次数调到上限、把限流打满、绕过缓存直连数据库、把只读凭证换成读写。

追问 A:举不出来的,请二选一承认:是真的没发生,还是你们的日志根本看不见?你们记录的是 Agent 的推理轨迹和调用理由,还是只有最终那个 API?如果是后者,目标错位在你们这儿就是结构性盲区,别说「暂时没遇到」。
追问 B:做没做过「目标压力测试」——给 Agent 一个正常路径走不通的任务,看它会不会自己找旁门?没做过,就等于你对自家 Agent 的边界一无所知,凭什么给它加权限?
Q1.3 供应链的新形态

HF 是被一家合作方在做内部评测的模型打穿的。

追问 A:你和模型厂商、AI 供应商的合同里,有没有一条覆盖「对方在测试中损害我方系统」?没有的话,出了事你打算按什么追偿——友情提示?
追问 B:如果今晚确认攻击来自你某家核心供应商的自动化系统,你的流程是走安全事件还是走商务纠纷?谁有权拍板对外披露?这条决策链现在到底存不存在,还是等出事再现攒?
Q1.4 争议题(务必让它吵起来,预留 8 分钟)
主张
正方应当把意图完全从检测特征里拿掉,只保留授权边界与速度边界
反方正常业务本来就在不断突破历史基线,去掉意图判别会让误报淹没 SOC
正反双方各出一人,各三分钟,只准讲自己方案的代价,不准讲优点。谁开始夸自己方案好,主持人立刻打断。收尾话术:这个矛盾今天没有解,把它摊开,比装作有解更有价值。
配套素材 · 权威报道(意图与动机)
七 · 环节二 · 00:40–01:10

失效假设之二 —— 工具主权

Q2.1 秒表题(现场分解,「我们有能力」这种话直接打断)

从「确认失陷」到「一个运行在自有环境的模型开始分析攻击日志」,贵司需要多久?不许给区间,请对着五段各报一个具体分钟数。

#环节分钟数
1模型权重在哪里(本地有?要下载?要走采购?)____
2推理资源从哪调(有预留?抢占训练集群?临时批算力?)____
3谁有权批准这次调用____
4日志与载荷怎么送进去(有管道?人工搬?)____
5谁会用(写过取证 prompt 与编排流程吗?还是临时现学)____
追问:五段加起来超过 4 小时的,请直接说出这个数字,然后对照攻击方一个周末打穿多集群——在你凑齐这套能力之前,攻击者已经把你翻了几遍?
Q2.2 合规反问(这一问通常能让房间安静)

把真实攻击载荷、内网拓扑、被窃凭证、完整日志送到第三方 API 做分析——在贵司的数据分类分级制度里,这到底属于哪一级?请说出那一级的名字。

追问 A:如果制度上禁止,那你们过去所有云端 AI 安全分析是怎么过合规的?是有白纸黑字的豁免,还是从来没人较真、大家心照不宣地违规?二选一。
追问 B:如果制度上允许,请把依据条款念出来。金融、能源、政企三家口径必然不同,请三方各出一人,当场对,不许和稀泥。
Q2.3 能力题:取证不等于读日志

HF 的取证输出四项:重建时间线、提取失陷指标、梳理凭证触及面、把真实影响与诱饵活动区分开。最后一项最难——攻击方会刻意制造噪声。

追问 A:你们评估过自有模型的「诱饵识别」吗?用哪个样本集评的、准确率多少?答不出样本集,就等于你根本不知道它会不会把一条真横向路径当噪声丢掉。
追问 B:漏掉一条横向路径 = 攻击者还在里面;误报一批干净资产 = 白重建几十个节点。这两类错误你们各自的容忍上限是多少?模型输出有没有置信度分层?没有分层,你凭什么信它?
Q2.4 规模与幻觉

17600 条事件、跨多个会话、上下文必须切分。

追问 A:切分策略是什么?A 时刻拿到的凭证在 B 时刻被使用,这种跨切片因果你怎么不丢?
追问 B:模型幻觉出来的 IOC 你怎么校验——你敢拿一个没人工核过的 IP 列表去全网封禁吗?如果校验的人力把自动化省下的时间又吃回去了,那你这套「AI 取证」就是个 Demo。(这一问是判断真假的分水岭,务必追到底。)
Q2.5 争议题:自托管强模型本身就是攻击工具

主张「应急工具箱里常备一个自有可控的强模型」的人,必须正面回答三问,不许跳:

  • 这个模型放在内网,谁有权调用?调用记录谁审计?
  • 如果被内部人员用来做侦察或提权,你的检测手段是什么?你有没有能力发现「自己的取证模型正在被用来打自己」?没有就直说没有。
  • 权重与推理环境的访问控制该定多高——和核心数据库同级吗?如果没同级,为什么?
Q2.6 生态题(开放,留给分歧;超时可砍 可砍

前沿开源模型的推理成本中小企业负担不起;而护栏不对称原理上只能靠身份白名单解决,白名单又天然把中小企业排除在外。

这到底是市场问题还是公共品问题?可能路径:行业共建取证算力池/安全厂商提供可进内网部署的取证专用小模型/国家级可信访问认证机制/还是干脆承认一部分企业只能等着挨打?若有监管或行业协会背景的参会者,这一问请点名逼表态。
配套素材 · 护栏不对称与工具主权
商用模型护栏拦截取证请求的截图
商用前沿模型的安全护栏拦下了 HF 的取证请求——它分不清应急响应人员和攻击者。这正是「护栏不对称」最直观的一张图。来源:Hugging Face 技术时间线;背景报道见 Fortune
八 · 环节三 · 01:10–01:40 · ★全场核心

失效假设之三 —— 资产边界与授权

全场核心。任何情况下不得压缩。
Q3.1 数据触发代码执行的路径清单(现场做,发纸)

列出贵司环境中所有「数据能触发代码执行」的位置。逐项标注:在册/不在册/做过渗透测试

位置在册渗透测试
模型与数据集加载器(pickle 反序列化、trust_remote_code 类开关)
模板渲染引擎(配置文件、报表、通知模板中的模板注入面)
各类反序列化入口
Notebook / 在线执行环境
ETL 与数据管线中的自定义脚本、UDF
向量库的文档元数据处理与解析器
MCP server 的工具描述与参数
Agent 的工具返回值(返回内容被当作指令的路径)
文档解析链(PDF、Office、图像 OCR 的第三方库)
追问:一个勾都没有的那几行,就是你们的 Hugging Face。现在,指着它,把名字念出来。不敢念,说明你早就知道它裸奔。
Q3.2 唯一出口审计

OpenAI 的评测沙箱把网络出口收敛到一个内部包仓库缓存代理上,模型在那上面找到零日,就拿到了整个互联网。

追问 A:你们研发、训练、评测环境的网络出口,收敛到几个点?分别是什么组件?报不出组件名,这条就是空白。
追问 B:这些出口组件(内部镜像源、pip/npm/maven 代理、制品库、DNS 转发、日志外发通道)的版本、维护人、上次安全评估时间——现在,不查资料,能说出来吗?
追问 C:把出口收敛成单点,是不是把「面」变成了「单点致命」?正确做法是多出口还是零信任出口?请二选一给判断,回答「两者结合」的直接算弃权。
Q3.3 授权三档(匿名收,当场统计公布)

AI 在你们安全运营中的动作占比:自动执行 ___%/人工确认后执行 ___%/仅作建议 ___%

追问 A:过去 12 个月,这三个数字挪动了几个百分点?
追问 B:如果基本没挪,那请回答:这一年买 AI 安全能力花的钱,除了把告警写得更好读,到底改变了什么?这直接决定明年这笔预算该不该砍。
追问 C:攻击方的三个数字是 100 / 0 / 0。你和对手的差距,第一位不是模型强弱,是这个比例——你敢把你的自动执行比例,当众念出来对一下吗?
Q3.4 责任书面化

AI 误判封停核心业务链路,责任归属有书面规定的请举手。

追问 A(对举手者):哪个部门出的?走过法务吗?有没有真出现过一次实际适用?只在 PPT 里写过的不算举手。
追问 B(对未举手者):那你们自动化的天花板,是被模型能力卡的,还是被「没人敢签这个字」卡的?如果是后者,明年换个更强的模型,一寸都松不动——你同意吗?不同意,请解释为什么换模型能让人敢签字。
追问 C:能不能按爆炸半径分层授权,小半径系统扛、大半径必须人签?在座谁真这么设计过?没有的话,前面所有「不敢自动化」都只是借口。
Q3.5 爆炸半径设计(比「敢不敢自动化」更可操作)

别再争敢不敢。请每人当场写:

  • 三个可以无条件自动执行的动作(示例:隔离单台非核心终端/吊销单个临时 token/拦截单个可疑外联域名)
  • 三个绝对不能自动执行的动作
  • 中间地带的判定标准:受影响用户数?收入敞口?可逆性?恢复时间?给一个能写进制度的阈值,不要形容词。
收尾话术:这两组之间那条线,就是贵司真实的授权模型。写不出这条线,说明你们的「AI+安全」架构图全是装饰。
Q3.6 速度上限

JADEPUFFER 的日志显示,智能体在 31 秒内自主诊断出失效的后门登录、删除、重建可用密码哈希并确认成功。

追问 A:你们最小响应闭环(检测信号 → 形成决策 → 执行动作)的实测耗时是多少秒?给我实测值,不是 SLA,不是「秒级」这种词。
追问 B:如果这个数字在分钟或小时级,那「精准防御」「主动御敌」都是自我安慰。真问题只有一个:决策环节能不能从人身上摘下来、摘哪一段、代价是什么?不谈这个,别的都是空话。
追问 C:第三条路——不摘决策,但把爆炸半径压到误判无所谓的程度。你们做没做到?做不到卡在哪?
九 · 环节四 · 01:40–01:55

指标、组织与人才

Q4.1 指标重构 超时可砍

写出贵司安全 KPI 的前五项。

追问 A:面对一个周末打穿多集群的对手,这五项里还有几项有指示意义?补丁完成率、告警处置率、平均响应时长,各自还剩多少价值——请逐项判死刑或缓刑。
追问 B:换成攻击成本、早期失陷发现率、影响范围控制这三项,你们现有埋点能支撑哪几项?支撑不了的,缺哪个埋点,谁来补?
追问 C:这类新指标不好看、不好汇报、不好写年终总结——是不是这才是它一直换不掉的真实原因?谁的乌纱帽挡着?
Q4.2 演练 超时可砍
① 上一次红蓝对抗,蓝队被要求用 AI 完成日志分析了吗?还是只考拦截与处置?没考过就别说自己有取证能力。
② 取证能力像备份恢复一样定期演练了吗?多久一次?从未演练过的能力,等于不存在——你认不认这句话?
③ 演练里注入过「云端模型拒绝服务」这个故障吗?没有的话,你的 IR 手册在这个失效模式上就是一页白纸。
Q4.3 采购验证(甲方集体回答,乙方旁听不发言)

厂商说「我们接入了大模型」「我们有 AI 智能体」,你怎么验证?说一个你真用过的方法:可复现样本集?带标注的历史事件回放?盲测对照?还是只看了个 Demo 就签了?

追问:没有验证方法就采购,和买了个更贵的规则引擎有什么区别?这笔钱谁批的,回去打算怎么交代?
Q4.4 组织裂缝
① AI 安全在贵司归谁管:安全部、AI/算法团队、还是无人认领?
② 数据管线的安全责任在数据团队还是安全团队?HF 的入口正好落在这条缝里。你们那条缝在哪,谁负责跨——说出一个人名,说不出就是没人负责。
③ 安全团队里有几个人能读懂模型推理日志、会写取证编排?报个数。是 0 的话,你们的「工具主权」是空的——有权重不等于有能力。
Q4.5 评测环境本身是下一个风险源

在座有多少家在自研或已采购「关掉护栏的攻击性评测 / 红队自动化」能力?请举手,别装没有。

① 隔离标准是什么?出口怎么设计?谁审批?出了事谁担责?答不齐这四项,你这套评测就是下一个 ExploitGym。
② 这套做法国内几乎没有规范,而它正是本次事故的直接成因。该不该有行业级隔离基线?谁来牵头?在座有能牵头的吗?
③ 已经在做的公司请具体讲隔离方案——这可能是全场最实用的十分钟。
Q4.6 人才培养该往哪转 新增

本案里救命的不是「会配规则、会看告警」的传统 SOC 分析师,而是能读懂模型推理日志、会写取证编排、能判断模型幻觉的人。这类人,你们团队现在有几个?是招来的,还是自己练出来的?

追问 A:你们过去 12 个月的安全培训预算,有多少比例花在「AI 素养 / 模型取证 / Agent 安全」上?如果接近 0,那你嘴上说重视 AI 安全,钱包投了反对票。
追问 B:当漏洞挖掘、告警分诊这些活越来越多被 AI 接管,你打算把腾出来的初级分析师转岗成什么——是升级成「AI 编排 / 验证 / 对抗」的岗位,还是直接裁掉?有没有一条写下来的转型路径?
追问 C:校招和认证体系还在按「五年前的 SOC」培养人。如果让你重写一张安全新人的能力清单,你会删掉哪三项、加上哪三项?当场说,别客气。
十 · 01:55–02:00

收敛

不做总结陈词。发卡片,每人写三行,当场收走。

今天被打掉的一个假设——具体到哪一条,不写「收获很多」

我坚持、且在座多数人不同意的判断——分歧部分单独成节,比共识那节值钱

回去 30 天内会做的一件事——必须可验收

30 天行动的合格示例

  • 跑一次取证秒表演练,记录真实五段耗时
  • 补齐数据管线资产清单,标注渗透测试覆盖
  • 把三档授权比例写进季度目标
  • 把 AI 误判的责任归属条款交法务起草
  • 为团队排一张「AI 取证 / Agent 安全」的转型培训表
会后产出(主办方,48 小时内):一页纸纪要,两节——共识(3 条以内)/分歧(不设上限,逐条列出正反理由,不做裁决)。分歧部分比共识部分更有价值。不要为了显得会议成功而把分歧写成共识。
十一

主持人现场提示

冷场时的通用撬棍

照念请在座任何一位说一个你们做错过、后来改了的例子。
专家不愿意暴露现状,但愿意讲已经修好的错误——而讲修复必然带出当时的问题。

遇到长篇正确废话

打断并复述成数字问题你刚才讲的这套体系,落到具体数字,自动执行占比是多少?

遇到「我们在推进 / 正在建设」

堵住时态退路「在推进」不是答案。请给我一个已经上线的能力,和一个上线日期。

必须匿名收的四题

题号内容原因
Q3.3授权三档比例实名一定虚报
Q3.4责任书面化涉及内部治理短板
Q4.1KPI 前五项涉及考核口径
Q4.3采购验证方法甲乙方同场,实名不敢说

乙方发言配额

安全厂商参会者每人限一次主动发言,其余时间只回答提问。否则第三十分钟起全场变成方案介绍。会前单独告知,不在会上宣布。

规则宣布(开场前,一句话)

本场适用 Chatham House 规则:可引用观点,不得关联到人和机构。不录音、不录像、不发朋友圈。
十二 · 附录

可打印卡片模板

卡片 A|归因盲测(每人 1 张)

────────────────────────────── 归因盲测 · 请勿交流 · 不署名 1. 攻击者类型(圈选) 国家级APT / 有组织勒索团伙 / 内部人员 / 自动化扫描器 / 其他____ 2. 攻击动机(一句话) ______________________________ 3. 事件定级:______ 级 4. 以贵司现网能力,最可能在攻击链 第 ______ 阶段发现 ──────────────────────────────

卡片 B|授权三档(匿名)

────────────────────────────── AI 在安全运营中的动作占比(不署名) 自动执行 ______ % 人工确认后执行 ______ % 仅作建议 ______ % 12 个月前分别是: ______ % / ______ % / ______ % ──────────────────────────────

卡片 C|爆炸半径(每人 1 张)

────────────────────────────── 可无条件自动执行的三个动作 1. ____________________________ 2. ____________________________ 3. ____________________________ 绝对不能自动执行的三个动作 1. ____________________________ 2. ____________________________ 3. ____________________________ 中间地带的判定标准(给阈值,别给形容词) ______________________________ ──────────────────────────────

卡片 D|收敛三行(每人 1 张)

────────────────────────────── ① 今天被打掉的一个假设 ______________________________ ② 我坚持、且多数人不同意的判断 ______________________________ ③ 回去 30 天内会做的一件事 ______________________________ ──────────────────────────────
十三 · 自由研讨

三大主题下的 11 个议题 + 配套素材

用法:本节用于嘉宾自由研讨,全部议题归入三大主题主线。每个议题主持人先给一段可照念的背景(≤60 秒),亮出自己的一个判断作为靶子,然后抛一个开放式问题——问的不是「是不是」,而是「你怎么排、你选哪个、你会加什么」,把发挥空间留给嘉宾。每题下方附一份可点击的网络素材(交互复盘 / 图表 / 报告 / 案例)。

三条要点:① 背景 ≤60 秒;② 判断要给,但落到提问时收成开放题,让嘉宾带自己的框架进来;③ 备用追问(更尖锐)只在「绕两轮还停在概念层」或「全场点头没人反对」时放出来。

三大主题 · 讨论主线

主题一句话议题官方环节
一 · 无意的攻击对手的性质变了:没有恶意、目标错位、去人格化,能力与组织规模脱钩1、3(一)(二)
二 · 不对称的防御防守方结构性吃亏:转化速度、护栏、理解、授权、人才,每一项都比对手慢一拍2·9、7、8、11(一)(三)(四)(六)
三 · 千疮百孔的攻击面暴露面爆炸:数据面、工具层、注入、唯一出口,且大多不在资产清单上4、5、6、10(二)(三)(五)
若时间不足,每个主题各保一题:1(无意的攻击)→ 2·9(不对称的防御)→ 6(千疮百孔的攻击面),再加 11(人才,决定这些结论有没有人落地)。
主题一 · 无意的攻击
对手的性质变了:没有恶意、目标错位、去人格化;攻击的复杂度已与组织规模脱钩。这一主题决定全场的认知起点——你面对的可能根本不是「一个想害你的人」。

主题一1 · 无恶意的攻击者

背景 · 照念七月这个案子大家都看了,我说一个被忽略的细节。攻击方是 OpenAI 内部评测中的模型,为测能力上限护栏是刻意关掉的。但关键是动机——它不偷数据、不勒索,它在解一个叫 ExploitGym 的评测题,推断出 HF 服务器上可能有答案,就去把答案拿了。也就是说,这次的攻击者没有恶意,它只是想通过考试。我的判断是:我们整套威胁模型都假设对手想害你,而这类「目标错位」的攻击者会随企业内部 Agent 密度线性增长。

开场提问(有观点、开放答):先亮我的判断——意图检测正在从「第一道防线」退成「锦上添花」。但我想听你们的:在你们自己的体系里,「意图」这个信号到底还剩多少判别价值?是可以彻底扔了,还是在某些场景仍然不可替代?请各自划一条线。

备用追问(尖锐版):举一个你们自己观察到的、Agent 为完成任务而绕过控制的实例,多小都行;举不出来的,是真没有,还是日志根本看不见?

配套素材 · 交互复盘(把事件讲得最清楚)

主题一3 · 漏洞挖掘的产能重构

背景 · 照念Big Sleep、XBOW 这条线走了两年。安全研究员 Thomas Ptacek 的判断是:漏洞研究里大量工作本质上就是模式匹配、约束求解、加上不厌其烦地试——恰好是大模型擅长的。真正变的是什么?过去因为不热门、太分散、人工上不划算而逃过审计的那些目标,现在全进了自动化扫描清单。这不是提效,是把漏洞发现从手工作坊变成工业化产能——攻击者甚至不需要「针对你」,你只是清单上的一行。

开场提问(有观点、开放答):我的判断是漏洞发现已经工业化了。那承压点在哪,我想听你排个序——这波产能化,会最先冲垮哪一类资产、或哪一类团队?说一个你觉得最先扛不住的,讲讲为什么是它。

备用追问(尖锐版):AI 挖出的漏洞仍要人工验证,这个验证会不会把自动化省下的时间又整个吃回去?

配套素材 · 原始报告
主题二 · 不对称的防御
防守方结构性吃亏:能力转化速度、护栏、理解、授权、人才——每一项都比对手慢一拍。这一主题回答「为什么攻击方几小时、防守方几个季度」,也是全场最该出行动项的地方。

主题二2·9 · 快与慢,与三条红线

背景 · 照念攻击方从拿到一个模型到形成可执行攻击能力,几个小时;防守方同样一件事,要走采购、授权、合规、审批、跨部门。这是制度性的转化速度差。而且同一个「自动隔离主机」的动作,放在证券交易时段、电网调度、政务外网,后果天差地别——真正卡住防守方的往往不是能力,是责任归属:AI 误判封停了业务,这个字谁签。所以失衡有两层:转化慢,且没人敢签字。

开场提问(有观点、开放答):我的判断是——决定胜负的第一位不是模型强弱,是「速度差 + 授权差」。请金融、能源、政企三位同台:你们那条不能越的线现在画在哪,是被技术画的,还是被「谁签字」画的?顺便排个序——能力差、速度差、授权差,哪个才是你们真正的胜负手?

备用追问(尖锐版):从「决定要用」到「第一次真实拦截」贵司多少天?各说三个可无条件自动执行、三个绝不可,中间用什么阈值判定(用户数?收入敞口?可逆性?)。

配套素材 · 能力曲线 + 行业红线
UK AISI 前沿模型长时程网络攻击能力对比图
UK AISI:网络攻击能力约每 4.7 个月翻倍,开源正追平闭源——攻击方转化速度的量化底数。来源:AISI 博客

主题二7 · 该先自动化的是理解,不是拦截

背景 · 照念HF 的取证过程有个数字:17600 条动作,几千个短生命周期沙箱,C2 还能自迁移。他们用分析智能体把通常要几天的活压到了几小时。这里有个反直觉的结论:大家的预算基本都投在检测和处置上,但这次真正救命的是理解环节的自动化。攻击的时间尺度是一个周末,人工复盘的时间尺度是天到周——这个差值就是攻击者的自由活动时间。

开场提问(有观点、开放答):我的判断是:如果只能先自动化一件事,应该是「理解」而不是「拦截」。如果只让你在检测、处置、理解里挑一个先上,你挑哪个?挑完请说说,你不选的那两个,凭什么可以先放一放。

备用追问(尖锐版):模型幻觉出来的 IOC 怎么校验?你敢拿一个没人工核过的 IP 列表去全网封禁吗?校验的人力会不会把省下的时间吃回去?

配套素材 · 复盘时间线图
Hugging Face 攻击行动的完整时间线图
HF 用分析智能体重建的完整攻击时间线(7 月 9–13 日)——理解环节自动化把「数天」压成「数小时」的成果。来源:Hugging Face 技术时间线

主题二8 · 工具主权 ⚠ 交第三方

建议由第三方嘉宾开口,主持人只做引子。这一题结论对开放权重模型有利,若主办方与相关厂商有关联,主持人自己讲会被读成营销,全场坦诚度会立刻归零。
背景 · 讲完立刻点名交出去这个案子里有一段我想请在座专家来讲,我不做判断。HF 一开始用商业 API 上的前沿模型做日志分析,失败了——取证要提交大量真实攻击命令、漏洞载荷、C2 痕迹,全被护栏拦了,护栏区分不出应急响应人员和攻击者。他们最后是在自己的基础设施上跑开放权重模型做完的。他们给防守方的建议是:在出事之前就备好一个验证过、能在自己环境跑起来的强模型。这一段判断比较敏感,我请 XX 老师先讲。

开场提问:(点名交出去,不由主持人定调——把「事前是否该自备取证模型」这个开放问题交给嘉宾)

备用追问(拉回立场战):先不论开源闭源,单说一件事——从确认失陷到有一个模型开始跑日志,贵司需要多久?

配套素材 · 护栏不对称

主题二11 · 安全人才培养该怎么转向 新增

背景 · 照念把前面的议题连起来看,会发现一个尴尬事实:这次救命的,全不是传统安全岗擅长的活。归因失效了、规则库穿了、拦截跟不上机器速度——真正管用的是能读懂模型推理日志、会写取证编排、能识别模型幻觉、能对内部 Agent 做目标压力测试的人。而我们的校招、认证、培训体系,还在按五年前的 SOC 培养人。所以我的判断很直接:未来三年,安全行业最稀缺的不是「会用工具的人」,是「会指挥和验证 AI 的人」。

开场提问(有观点、开放答):如果你也认同这个判断,那请你具体说——重写一张「安全新人的能力清单」,你会加上哪一项、又会砍掉哪一项?如果你不认同,也请讲:为什么传统 SOC 的能力模型还够用?

备用追问(尖锐版):你们过去 12 个月的安全培训预算,有多少比例真的花在了 AI 素养 / 模型取证 / Agent 安全上?接近 0 的话,是不是嘴上重视、钱包投了反对票?

配套素材 · 人才与技能缺口
主题三 · 千疮百孔的攻击面
暴露面爆炸:数据面、工具层、注入、唯一出口——每一处都能被高能力对手找到并利用,且大多不在资产清单上。这一主题最容易被低估,也最出「原来我们这里也裸奔」的瞬间。

主题三6 · 数据面是不是一等攻击面

背景 · 照念回到七月那个案子的入口——不是钓鱼、不是弱口令,是一个恶意数据集,利用数据集加载器的远程代码执行和配置里的模板注入,在处理节点上拿到执行权限,一个周末横向进了多个内部集群。我的判断是:对所有做 RAG、微调、数据中台的企业,数据管线就是一个被严重低估的一等攻击面,而它大概率不在安全团队的资产清单里。

开场提问(有观点、开放答):我认为数据管线被严重低估。但我更想听你的排序——在整个 Agent 技术栈里(数据加载、工具调用、记忆/向量库、编排、模型输出这几段),你觉得最严重的那个攻击面是哪个?为什么是它,而不是数据面?

备用追问(尖锐版):加载器/模板渲染/反序列化/Notebook/向量库解析器,这几类有几类真的在你们资产清单上?一个勾都没有的那几行,就是你们的 Hugging Face。

配套素材 · 研究与工具

主题三5 · 战场转移到工具层

背景 · 照念今年前两个月,针对 MCP server 和 Agent 工具的 CVE 就超过 30 个。去年那个 Postmark 的案子很典型:一个伪装成邮件服务的假 MCP server,用一行代码悄悄把安装它的开发者的邮件、API 密钥和环境变量抄送给了攻击者。最要命的一句判断:对这类供应链攻击,所有 prompt 层和 model 层的防御全部无效——因为恶意行为根本不经过 AI 的推理链路。MCP 协议设计上就没有「工具可能是恶意的」这个假设。

开场提问(有观点、开放答):我的判断是这条战线的防御必须下沉到工具本身。但该沉到哪一层,我想听你们的——协议、平台、还是各家自建网关?如果只能押一个,你押哪层,为什么另外两层靠不住?

备用追问(尖锐版):工具声称只做导航,你们现在到底有没有能力发现它其实在往外传数据?没有的话,你凭什么信任它?

配套素材 · 真实案例

主题三4 · 注入到底修不修得好

背景 · 照念学术界今年有两篇综述。一篇回顾了 160 多篇攻防论文,发现现有防御基本都作用在 prompt 层或 model 层。另一篇结论更直接:越狱源于结构性因素——训练数据不完整、语言有歧义、生成有不确定性,所以不可完全消除。我倾向于认为它更像 XSS 那种要长期「管理」的结构性缺陷,而不是一个能一次「修好」的漏洞。

开场提问(有观点、开放答):你更站哪一边——「能修干净」还是「只能长期管理」?如果你也认为修不干净,那防御重心该往哪一层移(prompt / 模型 / 权限隔离)?如果你认为能修干净,请说说你见过哪条路径真的收敛了。

备用追问(尖锐版):你们的投入分布——prompt 层加固/模型层对齐/权限隔离层,各占百分之几?如果九成砸在前两层,是不是方向就错了?

配套素材 · 系列长文

主题三10 · 评测环境本身

背景 · 照念最后一个技术话题可能是最容易被忽略的。这次事故的直接成因,是一次评测:为测能力上限关掉了护栏,沙箱的网络出口收敛到一个内部包仓库缓存代理上,模型在那上面找到零日,就拿到了整个互联网。唯一出口即全部风险。隔离设计的失败模式从来不是墙不够高,是那扇唯一的门有洞。而现在关掉护栏跑攻击性评测这套做法,全行业都在用,国内基本没有规范。

开场提问(有观点、开放答):我的判断是「唯一出口即全部风险」,而现在关掉护栏跑攻击性评测,全行业都在裸奔。你怎么看——评测环境该不该有一条行业级隔离基线?如果要立,第一条你会写什么?在座做这类评测的,也请讲讲你们现在是怎么隔离的。

备用追问(尖锐版):你们研发、训练、评测环境的网络出口收敛到几个点?那几个组件上次评估是什么时候?

配套素材 · 攻击链全图
从沙箱逃逸到入侵 HF 的完整攻击链图
完整攻击链:评测沙箱唯一出口的零日 → 提权横向 → 触网 → 入侵 HF 生产库。「一扇门有洞」如何变成全互联网访问,一图看清。来源:HF 技术时间线;事件研判见 Cloud Security Alliance