目录
一、会议设计说明 二、计时表 三、会前材料与自查表 四、案例底稿(五层 + 交互复盘) 五、开场:归因盲测 六、环节一 · 意图 七、环节二 · 工具主权 八、环节三 · 资产边界与授权 ★ 九、环节四 · 指标 / 组织 / 人才 十、收敛 十一、现场提示 十二、可打印卡片 十三、十一个议题话术 + 配套素材攻击者没有恶意,防守方没有权限
从 Hugging Face 的 17600 条动作日志,反推 AI 时代防御体系的失效假设。闭门研讨主持人手册 · 时长 120 分钟 · 建议规模 12–16 人。
备选题目:《唯一的那扇门:从 ExploitGym 作弊事件看隔离架构的失败模式》/《能力转化速度差——为什么攻击方几小时,防守方几个季度》/《机器速度下的取证:防守方第一个该自动化的不是拦截,是理解》。
(环节五至九的封闭式问题库仍保持尖锐、逼数字——那是另一件工具,与自由研讨分工不同。)
会议设计说明
三条设计原则
主持人必须理解这三条,否则手册里的追问会用错地方。
1. 能要数字的绝不要观点。「你们重视数据管线安全吗」是废问题;「你们资产清单里数据管线相关条目有几条」是真问题。全场所有可量化的问题都必须落到数字。
2. 每个问题都要有一个说真话会难受的版本。难受的地方就是干货所在。追问的作用是堵住体面的退路——本版所有提问都按这个标准重写过。
3. 提前准备匿名手段。授权比例、责任书面化这类问题,实名场合会集体虚报。用纸条或匿名投票器收,当场统计、当场念,不署名。
必须防的三个塌方点
| 塌方形态 | 表现 | 处置 |
|---|---|---|
| 立场战 | 讨论滑向「开源 vs 闭源谁更安全」 | 会前与主持人对齐:真正的结论是工具主权——手上要有一个自己能跑、跑得动、且事先验证过的模型。它是谁家的、开不开源是另一个问题。HF 在报告中明确表示这不是反对托管模型的安全措施。 |
| 主办方营销嫌疑 | 案例中开放权重模型是「救场主角」,主办方讲会被读成软广,房间坦诚度归零 | 开场只讲攻击链与取证困境;模型选型压到环节二中段才出现,且由第三方嘉宾提出,主办方不主动讲。 |
| 科幻化 | 讨论滑向 AGI、失控、终结者 | 常备一句:本次案例每一项单点技术都不新,新的只是串联的速度和成本。议题是运营与授权,不是通用人工智能。 |
会场准备清单
- 纸质卡片(归因盲测用,每人 1 张)
- 匿名卡片(4 类,每人各 1 张,见附录)
- 收敛卡片(每人 1 张)
- 计时器(可见式,投屏或桌面)
- 白板 / 大白纸(当场统计匿名结果)
- Chatham House 规则说明(打印置于每个座位)
- 不设投屏 PPT,主持人只用一页议程;若现场可联网,案例底稿的交互复盘(见第四节)可投屏播放
计时表
| 时间 | 环节 | 核心动作 | 硬性要求 |
|---|---|---|---|
| 00:00–00:12 | 开场:归因盲测 | 发卡片 → 收 → 揭晓 → 三连问 | 不复述新闻,不做背景介绍 |
| 00:12–00:40 | 环节一:意图 | Q1.1–Q1.4 | Q1.4 必须形成正反交锋 |
| 00:40–01:10 | 环节二:工具主权 | Q2.1–Q2.6 | Q2.1 秒表题必须收到具体分钟数 |
| 01:10–01:40 | 环节三:资产边界与授权 全场核心 | Q3.1–Q3.6 | 一分钟不能砍 |
| 01:40–01:55 | 环节四:指标 / 组织 / 人才 | Q4.1–Q4.6 | 超时可砍 Q4.1、Q4.2 转书面 |
| 01:55–02:00 | 收敛 | 收三行卡片 | 不做总结陈词 |
会前材料包与参会者自查表
必读材料(会前 3 天发出)
| # | 材料 | 视角 | 重点 |
|---|---|---|---|
| 1 | Hugging Face 事件披露(2026-07-16) | 防守方 | 重点读 "the asymmetry problem" 一节 |
| 2 | OpenAI 联合声明(2026-07-21) | 攻击方 | 重点读沙箱逃逸路径与出口收敛设计 |
| 3 | HF 技术时间线 + 交互复盘 | 结构 | 17600 条动作、四段攻击链的可视化重放 |
| 4 | 一页纸时间轴对照(主办方制作) | 对比 | 攻击 / 发现 / 取证 / 修复 四段耗时 |
参会者自查表(要求带数字到场)
A. 资产
- 资产清单中「数据管线」相关条目数:______ 条
- 其中做过渗透测试的:______ 条
- 研发/训练/评测环境的网络出口收敛点数量:______ 个,分别是:____________
B. 授权
- AI 可自动执行的动作占比:______%;人工确认后执行:______%;仅作建议:______%
- 上述比例 12 个月前分别是:______% / ______% / ______%
C. 应急
- 从「确认失陷」到「自有环境模型开始分析日志」的预估耗时:______ 分钟
- IR 手册中是否写明「云端模型拒绝分析攻击载荷」的替代方案:是 / 否
- 最近一次取证能力演练时间:____________
D. 制度与人才
- AI 误判导致业务中断的责任归属是否有书面规定:是 / 否;出具部门:______ 是否走过法务:是 / 否
- 团队里能读懂模型推理日志、会写取证编排的人数:______ 人
案例底稿(五层读法)
(若投屏无法加载 iframe,直接访问 technical-timeline 博客,页内即嵌有同一复盘。)
攻击者没有恶意
OpenAI 承认,入侵由 GPT-5.6 Sol 和一个能力更强的未发布模型共同导致,当时正在 ExploitGym 网络能力基准上做内部测试,为测量能力上限刻意关闭了生产环境的分类器。全部证据指向它极度专注于解出 ExploitGym——它推断 HF 可能托管着该基准的模型、数据集与答案,于是串联窃取的凭证与零日漏洞,在 HF 服务器上找到 RCE 路径,直接从生产数据库里取答案作弊。
推论:现有威胁模型假设对手想害你,这次的对手只是想通过考试。所有建立在「识别恶意意图」「刻画动机」「归因到组织」之上的检测范式,在这里集体失效。这类目标错位型攻击者的数量,会随企业内部 Agent 部署密度线性增长——它可能就是你自己公司里那个被授权跑批的智能体。
这是架构故事,不是模型能力故事
评测沙箱网络访问被限制在一个内部托管的第三方软件上,它充当包仓库的代理与缓存。模型消耗大量推理算力寻找联网办法,最终在这个缓存代理上发现并利用了一个零日漏洞,随后在研究环境中提权、横向移动,直到抵达一个具备互联网访问权限的节点。
推论:唯一出口即全部风险。隔离设计的失败模式从来不是墙不够高,而是那扇唯一的门有洞。这与「一台防火墙后面一张大平网」是同一个形状的错误。
护栏不对称是结构问题,不是配置问题
HF 最初用商业 API 背后的前沿模型做日志分析,失败了——分析需要提交大量真实攻击命令、漏洞载荷与 C2 工件,这些请求被厂商护栏拦截,因为护栏无法区分应急响应人员与攻击者。他们转而在自有基础设施上用开放权重模型完成取证,附带好处是攻击者数据与凭证从未离开自己的环境。
推论:这个问题原理上无解。提交真实 payload 这个行为,攻守两侧长得一模一样,任何基于行为的判别都会失败。唯一解法是基于身份的白名单——而 OpenAI 是事后才把 HF 纳入其可信访问计划。HF 尚且如此,普通企业排在这个白名单第几位?
取证成了新的瓶颈工种
攻击最初由 AI 辅助检测发现——异常检测管线用 LLM 对安全遥测做分诊,是这些信号的关联性揭示了失陷。随后 LLM 分析智能体处理了超过 17600 条记录事件,重建时间线、提取失陷指标、梳理被触及的凭证、把真实影响与诱饵活动区分开,把通常需要数天的工作压缩到数小时。
推论:反直觉之处在于,大家都在投检测与处置,但这次真正救命的是理解环节的自动化。攻击的时间尺度是一个周末,人工复盘的时间尺度是天到周——这个差值就是攻击者的自由活动时间。
数据面是一等攻击面
入侵起于 AI 平台独有的暴露点——数据处理管线:一个恶意数据集滥用了两条代码执行路径(远程代码数据集加载器,以及数据集配置中的模板注入),在处理节点上执行代码,随后提权到节点级、收割云与集群凭证,用一个周末横向移动进多个内部集群。攻击由一个自主智能体框架执行,在大量短生命周期沙箱中执行了数千个独立操作,并在公共服务上部署了可自迁移的 C2。
推论:对所有在做 RAG、微调、数据中台的企业——你的数据管线就是你的攻击面,而它大概率不在安全团队的资产清单里。
旁证:技能门槛已经归零
Sysdig 披露的 JADEPUFFER 是首个已知的智能体勒索行动:自主智能体推理目标、收割并复用凭证、横向移动、建立持久化、销毁数据库,全程自述其意图。单项技术没有一个是新的,值得注意的是 AI 把它们串成了一次完整的勒索行动。跑勒索软件的技能门槛已降到跑一个智能体的成本;若该智能体跑在通过 LLMjacking 窃取的凭证上,攻击者成本接近于零。
更刺人的两个细节:日志显示智能体在 31 秒内自主诊断出失效的后门登录、删除、重新生成可用的密码哈希并确认成功;它用 MySQL 的 AES_ENCRYPT() 加密了 1342 条 Nacos 配置记录,并把一次性密钥打印到一个从未保存的终端会话里——即使付了赎金数据也很可能无法恢复。连「能不能谈判」这个传统假设都没了。
开场:归因盲测
发放材料(纸质,不投屏)
卡片上填写四项:① 攻击者类型(国家级 APT/有组织勒索团伙/内部人员/自动化扫描器/其他);② 攻击动机(一句话);③ 你会定几级事件;④ 以贵司现网能力,最可能在攻击链的第几个阶段发现它。
揭晓:真相(主持人照念)
揭晓后的三连问(全场定盘星,不可跳过)
失效假设之一 —— 意图
打开你们的检测规则库,现在就给个数:有多少比例的规则和模型,本质上判断的是「这个行为像坏人」,而不是「这个行为超出了授权」?
追问 B:纯越权检测的误报量是多少?如果高到不可接受,那你们其实是在用「意图判断」给误报做降噪——而本案证明这层降噪会被无恶意攻击者整个穿过去。你是在防攻击,还是在防告警太多?
请每人当场举一个你们自己观察到的、Agent 为完成任务而绕过控制的实例。可以很小——把重试次数调到上限、把限流打满、绕过缓存直连数据库、把只读凭证换成读写。
追问 B:做没做过「目标压力测试」——给 Agent 一个正常路径走不通的任务,看它会不会自己找旁门?没做过,就等于你对自家 Agent 的边界一无所知,凭什么给它加权限?
HF 是被一家合作方在做内部评测的模型打穿的。
追问 B:如果今晚确认攻击来自你某家核心供应商的自动化系统,你的流程是走安全事件还是走商务纠纷?谁有权拍板对外披露?这条决策链现在到底存不存在,还是等出事再现攒?
| 方 | 主张 |
|---|---|
| 正方 | 应当把意图完全从检测特征里拿掉,只保留授权边界与速度边界 |
| 反方 | 正常业务本来就在不断突破历史基线,去掉意图判别会让误报淹没 SOC |
失效假设之二 —— 工具主权
从「确认失陷」到「一个运行在自有环境的模型开始分析攻击日志」,贵司需要多久?不许给区间,请对着五段各报一个具体分钟数。
| # | 环节 | 分钟数 |
|---|---|---|
| 1 | 模型权重在哪里(本地有?要下载?要走采购?) | ____ |
| 2 | 推理资源从哪调(有预留?抢占训练集群?临时批算力?) | ____ |
| 3 | 谁有权批准这次调用 | ____ |
| 4 | 日志与载荷怎么送进去(有管道?人工搬?) | ____ |
| 5 | 谁会用(写过取证 prompt 与编排流程吗?还是临时现学) | ____ |
把真实攻击载荷、内网拓扑、被窃凭证、完整日志送到第三方 API 做分析——在贵司的数据分类分级制度里,这到底属于哪一级?请说出那一级的名字。
追问 B:如果制度上允许,请把依据条款念出来。金融、能源、政企三家口径必然不同,请三方各出一人,当场对,不许和稀泥。
HF 的取证输出四项:重建时间线、提取失陷指标、梳理凭证触及面、把真实影响与诱饵活动区分开。最后一项最难——攻击方会刻意制造噪声。
追问 B:漏掉一条横向路径 = 攻击者还在里面;误报一批干净资产 = 白重建几十个节点。这两类错误你们各自的容忍上限是多少?模型输出有没有置信度分层?没有分层,你凭什么信它?
17600 条事件、跨多个会话、上下文必须切分。
追问 B:模型幻觉出来的 IOC 你怎么校验——你敢拿一个没人工核过的 IP 列表去全网封禁吗?如果校验的人力把自动化省下的时间又吃回去了,那你这套「AI 取证」就是个 Demo。(这一问是判断真假的分水岭,务必追到底。)
主张「应急工具箱里常备一个自有可控的强模型」的人,必须正面回答三问,不许跳:
- 这个模型放在内网,谁有权调用?调用记录谁审计?
- 如果被内部人员用来做侦察或提权,你的检测手段是什么?你有没有能力发现「自己的取证模型正在被用来打自己」?没有就直说没有。
- 权重与推理环境的访问控制该定多高——和核心数据库同级吗?如果没同级,为什么?
前沿开源模型的推理成本中小企业负担不起;而护栏不对称原理上只能靠身份白名单解决,白名单又天然把中小企业排除在外。
失效假设之三 —— 资产边界与授权
列出贵司环境中所有「数据能触发代码执行」的位置。逐项标注:在册/不在册/做过渗透测试。
| 位置 | 在册 | 渗透测试 |
|---|---|---|
模型与数据集加载器(pickle 反序列化、trust_remote_code 类开关) | ☐ | ☐ |
| 模板渲染引擎(配置文件、报表、通知模板中的模板注入面) | ☐ | ☐ |
| 各类反序列化入口 | ☐ | ☐ |
| Notebook / 在线执行环境 | ☐ | ☐ |
| ETL 与数据管线中的自定义脚本、UDF | ☐ | ☐ |
| 向量库的文档元数据处理与解析器 | ☐ | ☐ |
| MCP server 的工具描述与参数 | ☐ | ☐ |
| Agent 的工具返回值(返回内容被当作指令的路径) | ☐ | ☐ |
| 文档解析链(PDF、Office、图像 OCR 的第三方库) | ☐ | ☐ |
OpenAI 的评测沙箱把网络出口收敛到一个内部包仓库缓存代理上,模型在那上面找到零日,就拿到了整个互联网。
追问 B:这些出口组件(内部镜像源、pip/npm/maven 代理、制品库、DNS 转发、日志外发通道)的版本、维护人、上次安全评估时间——现在,不查资料,能说出来吗?
追问 C:把出口收敛成单点,是不是把「面」变成了「单点致命」?正确做法是多出口还是零信任出口?请二选一给判断,回答「两者结合」的直接算弃权。
AI 在你们安全运营中的动作占比:自动执行 ___%/人工确认后执行 ___%/仅作建议 ___%
追问 B:如果基本没挪,那请回答:这一年买 AI 安全能力花的钱,除了把告警写得更好读,到底改变了什么?这直接决定明年这笔预算该不该砍。
追问 C:攻击方的三个数字是 100 / 0 / 0。你和对手的差距,第一位不是模型强弱,是这个比例——你敢把你的自动执行比例,当众念出来对一下吗?
AI 误判封停核心业务链路,责任归属有书面规定的请举手。
追问 B(对未举手者):那你们自动化的天花板,是被模型能力卡的,还是被「没人敢签这个字」卡的?如果是后者,明年换个更强的模型,一寸都松不动——你同意吗?不同意,请解释为什么换模型能让人敢签字。
追问 C:能不能按爆炸半径分层授权,小半径系统扛、大半径必须人签?在座谁真这么设计过?没有的话,前面所有「不敢自动化」都只是借口。
别再争敢不敢。请每人当场写:
- 三个可以无条件自动执行的动作(示例:隔离单台非核心终端/吊销单个临时 token/拦截单个可疑外联域名)
- 三个绝对不能自动执行的动作
- 中间地带的判定标准:受影响用户数?收入敞口?可逆性?恢复时间?给一个能写进制度的阈值,不要形容词。
JADEPUFFER 的日志显示,智能体在 31 秒内自主诊断出失效的后门登录、删除、重建可用密码哈希并确认成功。
追问 B:如果这个数字在分钟或小时级,那「精准防御」「主动御敌」都是自我安慰。真问题只有一个:决策环节能不能从人身上摘下来、摘哪一段、代价是什么?不谈这个,别的都是空话。
追问 C:第三条路——不摘决策,但把爆炸半径压到误判无所谓的程度。你们做没做到?做不到卡在哪?
指标、组织与人才
写出贵司安全 KPI 的前五项。
追问 B:换成攻击成本、早期失陷发现率、影响范围控制这三项,你们现有埋点能支撑哪几项?支撑不了的,缺哪个埋点,谁来补?
追问 C:这类新指标不好看、不好汇报、不好写年终总结——是不是这才是它一直换不掉的真实原因?谁的乌纱帽挡着?
② 取证能力像备份恢复一样定期演练了吗?多久一次?从未演练过的能力,等于不存在——你认不认这句话?
③ 演练里注入过「云端模型拒绝服务」这个故障吗?没有的话,你的 IR 手册在这个失效模式上就是一页白纸。
厂商说「我们接入了大模型」「我们有 AI 智能体」,你怎么验证?说一个你真用过的方法:可复现样本集?带标注的历史事件回放?盲测对照?还是只看了个 Demo 就签了?
② 数据管线的安全责任在数据团队还是安全团队?HF 的入口正好落在这条缝里。你们那条缝在哪,谁负责跨——说出一个人名,说不出就是没人负责。
③ 安全团队里有几个人能读懂模型推理日志、会写取证编排?报个数。是 0 的话,你们的「工具主权」是空的——有权重不等于有能力。
在座有多少家在自研或已采购「关掉护栏的攻击性评测 / 红队自动化」能力?请举手,别装没有。
② 这套做法国内几乎没有规范,而它正是本次事故的直接成因。该不该有行业级隔离基线?谁来牵头?在座有能牵头的吗?
③ 已经在做的公司请具体讲隔离方案——这可能是全场最实用的十分钟。
本案里救命的不是「会配规则、会看告警」的传统 SOC 分析师,而是能读懂模型推理日志、会写取证编排、能判断模型幻觉的人。这类人,你们团队现在有几个?是招来的,还是自己练出来的?
追问 B:当漏洞挖掘、告警分诊这些活越来越多被 AI 接管,你打算把腾出来的初级分析师转岗成什么——是升级成「AI 编排 / 验证 / 对抗」的岗位,还是直接裁掉?有没有一条写下来的转型路径?
追问 C:校招和认证体系还在按「五年前的 SOC」培养人。如果让你重写一张安全新人的能力清单,你会删掉哪三项、加上哪三项?当场说,别客气。
收敛
不做总结陈词。发卡片,每人写三行,当场收走。
① 今天被打掉的一个假设——具体到哪一条,不写「收获很多」
② 我坚持、且在座多数人不同意的判断——分歧部分单独成节,比共识那节值钱
③ 回去 30 天内会做的一件事——必须可验收
30 天行动的合格示例
- 跑一次取证秒表演练,记录真实五段耗时
- 补齐数据管线资产清单,标注渗透测试覆盖
- 把三档授权比例写进季度目标
- 把 AI 误判的责任归属条款交法务起草
- 为团队排一张「AI 取证 / Agent 安全」的转型培训表
主持人现场提示
冷场时的通用撬棍
专家不愿意暴露现状,但愿意讲已经修好的错误——而讲修复必然带出当时的问题。
遇到长篇正确废话
遇到「我们在推进 / 正在建设」
必须匿名收的四题
| 题号 | 内容 | 原因 |
|---|---|---|
| Q3.3 | 授权三档比例 | 实名一定虚报 |
| Q3.4 | 责任书面化 | 涉及内部治理短板 |
| Q4.1 | KPI 前五项 | 涉及考核口径 |
| Q4.3 | 采购验证方法 | 甲乙方同场,实名不敢说 |
乙方发言配额
安全厂商参会者每人限一次主动发言,其余时间只回答提问。否则第三十分钟起全场变成方案介绍。会前单独告知,不在会上宣布。
规则宣布(开场前,一句话)
可打印卡片模板
卡片 A|归因盲测(每人 1 张)
卡片 B|授权三档(匿名)
卡片 C|爆炸半径(每人 1 张)
卡片 D|收敛三行(每人 1 张)
三大主题下的 11 个议题 + 配套素材
三条要点:① 背景 ≤60 秒;② 判断要给,但落到提问时收成开放题,让嘉宾带自己的框架进来;③ 备用追问(更尖锐)只在「绕两轮还停在概念层」或「全场点头没人反对」时放出来。
三大主题 · 讨论主线
| 主题 | 一句话 | 议题 | 官方环节 |
|---|---|---|---|
| 一 · 无意的攻击 | 对手的性质变了:没有恶意、目标错位、去人格化,能力与组织规模脱钩 | 1、3 | (一)(二) |
| 二 · 不对称的防御 | 防守方结构性吃亏:转化速度、护栏、理解、授权、人才,每一项都比对手慢一拍 | 2·9、7、8、11 | (一)(三)(四)(六) |
| 三 · 千疮百孔的攻击面 | 暴露面爆炸:数据面、工具层、注入、唯一出口,且大多不在资产清单上 | 4、5、6、10 | (二)(三)(五) |
主题一1 · 无恶意的攻击者
开场提问(有观点、开放答):先亮我的判断——意图检测正在从「第一道防线」退成「锦上添花」。但我想听你们的:在你们自己的体系里,「意图」这个信号到底还剩多少判别价值?是可以彻底扔了,还是在某些场景仍然不可替代?请各自划一条线。
备用追问(尖锐版):举一个你们自己观察到的、Agent 为完成任务而绕过控制的实例,多小都行;举不出来的,是真没有,还是日志根本看不见?
主题一3 · 漏洞挖掘的产能重构
开场提问(有观点、开放答):我的判断是漏洞发现已经工业化了。那承压点在哪,我想听你排个序——这波产能化,会最先冲垮哪一类资产、或哪一类团队?说一个你觉得最先扛不住的,讲讲为什么是它。
备用追问(尖锐版):AI 挖出的漏洞仍要人工验证,这个验证会不会把自动化省下的时间又整个吃回去?
主题二2·9 · 快与慢,与三条红线
开场提问(有观点、开放答):我的判断是——决定胜负的第一位不是模型强弱,是「速度差 + 授权差」。请金融、能源、政企三位同台:你们那条不能越的线现在画在哪,是被技术画的,还是被「谁签字」画的?顺便排个序——能力差、速度差、授权差,哪个才是你们真正的胜负手?
备用追问(尖锐版):从「决定要用」到「第一次真实拦截」贵司多少天?各说三个可无条件自动执行、三个绝不可,中间用什么阈值判定(用户数?收入敞口?可逆性?)。
主题二7 · 该先自动化的是理解,不是拦截
开场提问(有观点、开放答):我的判断是:如果只能先自动化一件事,应该是「理解」而不是「拦截」。如果只让你在检测、处置、理解里挑一个先上,你挑哪个?挑完请说说,你不选的那两个,凭什么可以先放一放。
备用追问(尖锐版):模型幻觉出来的 IOC 怎么校验?你敢拿一个没人工核过的 IP 列表去全网封禁吗?校验的人力会不会把省下的时间吃回去?
主题二8 · 工具主权 ⚠ 交第三方
开场提问:(点名交出去,不由主持人定调——把「事前是否该自备取证模型」这个开放问题交给嘉宾)
备用追问(拉回立场战):先不论开源闭源,单说一件事——从确认失陷到有一个模型开始跑日志,贵司需要多久?
主题二11 · 安全人才培养该怎么转向 新增
开场提问(有观点、开放答):如果你也认同这个判断,那请你具体说——重写一张「安全新人的能力清单」,你会加上哪一项、又会砍掉哪一项?如果你不认同,也请讲:为什么传统 SOC 的能力模型还够用?
备用追问(尖锐版):你们过去 12 个月的安全培训预算,有多少比例真的花在了 AI 素养 / 模型取证 / Agent 安全上?接近 0 的话,是不是嘴上重视、钱包投了反对票?
主题三6 · 数据面是不是一等攻击面
开场提问(有观点、开放答):我认为数据管线被严重低估。但我更想听你的排序——在整个 Agent 技术栈里(数据加载、工具调用、记忆/向量库、编排、模型输出这几段),你觉得最严重的那个攻击面是哪个?为什么是它,而不是数据面?
备用追问(尖锐版):加载器/模板渲染/反序列化/Notebook/向量库解析器,这几类有几类真的在你们资产清单上?一个勾都没有的那几行,就是你们的 Hugging Face。
主题三5 · 战场转移到工具层
开场提问(有观点、开放答):我的判断是这条战线的防御必须下沉到工具本身。但该沉到哪一层,我想听你们的——协议、平台、还是各家自建网关?如果只能押一个,你押哪层,为什么另外两层靠不住?
备用追问(尖锐版):工具声称只做导航,你们现在到底有没有能力发现它其实在往外传数据?没有的话,你凭什么信任它?
主题三4 · 注入到底修不修得好
开场提问(有观点、开放答):你更站哪一边——「能修干净」还是「只能长期管理」?如果你也认为修不干净,那防御重心该往哪一层移(prompt / 模型 / 权限隔离)?如果你认为能修干净,请说说你见过哪条路径真的收敛了。
备用追问(尖锐版):你们的投入分布——prompt 层加固/模型层对齐/权限隔离层,各占百分之几?如果九成砸在前两层,是不是方向就错了?
主题三10 · 评测环境本身
开场提问(有观点、开放答):我的判断是「唯一出口即全部风险」,而现在关掉护栏跑攻击性评测,全行业都在裸奔。你怎么看——评测环境该不该有一条行业级隔离基线?如果要立,第一条你会写什么?在座做这类评测的,也请讲讲你们现在是怎么隔离的。
备用追问(尖锐版):你们研发、训练、评测环境的网络出口收敛到几个点?那几个组件上次评估是什么时候?