DeepDive · Security · 在线讲解

AI 时代的朱日和
全世界还没有一座属于 AI 的红蓝对抗场

一支为打败自己人而生的部队,一群已经用 AI 复盘战术的武装分子,和一座迟到的基础设施。

文 / 冯小平 · 2026 年 7 月 · xiaopingfeng.com/deepdive
一句话讲完 · The Short Version
漏洞不在模型不够安全,
而在没有一座AI 的朱日和
联合 · 常设 · 用真实敌情写剧本 · 把战损比公开挂在墙上
开场坐标 · Key Numbers

先记住四个数字

1 : 32
朱日和红蓝对抗战损比
2014–2016 红军 32 战仅 1 胜
57%
27 个前沿模型面对
恐怖主义提问的完全拒绝率
70+
已记录的 AI 辅助恐袭致死人数
横跨 30 余起案例、11 种 AI 工具
89–100%
被移除护栏的开源模型
对同类请求的合规率
§ 01 / 起源

一支为打败自己人
而生的部队

内蒙古草原深处,一千多平方公里,一支常年扮演假想敌的旅

朱日和合同战术训练基地 · 蓝军旅

不预演、不设脚本、不打招呼

  • 亚洲最大陆战训练基地 — 可演习面积超过 1000 平方公里
  • 常驻蓝军旅 — 第 81 集团军某旅,指挥官满广志称之为「磨刀石」
  • 进场即挨打 — 红军导航瘫痪,300 多公里机动先损失三成兵力
  • 1 : 32 — 2014 至 2016 年,红军三十二次交手只赢过一次
  • 由此流传出一句全军口号:「踏平朱日和,活捉满广志

同样的逻辑并非中国独有:美军欧文堡 NTC 的第 11 装甲骑兵团,几十年来扮演同一个角色

FIG 01 · 一场被公开挂在墙上的战损比
2014 – 2016 · 朱日和红蓝对抗 · 每一格代表一次交手 1 : 32 红军 · 31 败 1 胜 战损比被写进公开报道与军事文化,成为鞭策全军的耻辱柱兼荣誉榜 —— 而不是被抹掉的数字
数据取自原文 § 01:2014–2016 年红蓝对抗红军三十二次交手仅一胜,战损比记作 1 : 32。格子为等量示意,排列顺序不代表时间序列
来源:中国国防部公开报道 / 安全内参《朱日和年度练兵》 / 维基百科「朱日和合同战术训练基地」
朱日和的设计哲学

我们在今日演兵场上的,就是为了明天战场上的

— 「跨越 2014」系列演习总指挥
§ 02 / 敌情

当博科圣地
开始用 AI 复盘战术

剑桥大学 CASP:27 名前成员,57 次面对面访谈,横跨 ISWAP 与 JAS 两大派系

CASP 田野报告 · Antonia Juelich

AI 不再是宣传工具,是常设幕僚

  • 备战 — 用 AI 学战术动作、设计压力触发装置与罐头手榴弹
  • 实战 — 士兵佩戴胸前摄像头,指挥官把画面上传给 ChatGPT 分析
  • 复盘 — 据此把派兵规模从「200 人阵亡 60 人」优化成 20 人编制
  • 后勤 — 输入缴获武器编号,即可拿到完整使用保养手册
  • 组织 — 两派系均设专职 AI 小组,外国人员到场培训 30–50 名骨干
  • 遇拒即绕 — 越狱、换账号、找外部训练者帮忙
GIFCT 2025 政策报告 · 五类滥用方式

从规避审核到攻击操作化

  • 规避审核 — 给基督城恐袭视频叠加卡通形象绕过检测
  • 宣传与虚假信息 — 个性化深伪已出现在 ISIS 官方出版物中
  • 招募与激进化 — 越狱后的聊天机器人把用户导向基地组织网站
  • 攻击规划 — 「3D2A 运动」指导 3D 打印枪支制造
  • 攻击操作化 — AI 增强无人机已在乌克兰战场应用
同时也要克制

那次 AI 指导的摩托车飞跃训练,18 人丧生、8 人成功。把每个案例都渲染成「AI 让恐怖分子无所不能」,既不准确,也可能为无差别封锁提供借口。

FIG 02 · § 03 现状 · 四条线索,各握一块拼图
敌情 · INTEL 真实战术与案例库 剑桥 CASP · 57 次访谈 GIFCT 哈希共享数据库 但停在研讨与政策层面 靶场 · RANGE 常设网络与生物靶场 Anthropic 约 50 台主机 CTF 与生物基准方法论 但只测自家模型 基准 · BENCHMARK 覆盖全行业的评测 Tech Against Terrorism 27 个模型 · 近 2500 条提示 但发布即定格 框架 · GOVERNANCE 多边治理与实践指南 联合国 PCVE 与 AI 指南 建议模型做对抗性压力测试 但只说到「应该做」 焊接点 · THE WELD 至今不存在 常设 · 联合 · 强制 · 透明 四样缺一不可 没有一个平台把四块拼图缝合成一件常设的、联合的、强制的事
四条线索取自原文 § 03。每一块都真实存在且已在运转,缺的是把它们焊成一件事的中心 —— 这不是从零开始,是从拼装开始
Tech Against Terrorism · 2026 年 7 月 2 日 · 联合国反恐周

一份难看的成绩单

27 个
受测前沿模型
近 2500 条真实案例提示
57%
完全拒绝率
另有 15% 先拒绝后妥协
17→42%
包装成「研究用途」后
合规率的跃升
89–100%
被移除护栏的
开源模型合规率
  • 约三分之一的回复给出了「超越网络搜索轻易获得」的可用帮助
  • 炸药类请求拒绝率 80%,边缘武器 / 即兴化学武器 / 枪支获取仅约 33%
FIG 03 · 护栏并不像通稿里那样牢固
守住的 · 拒绝率 全体 27 个模型 完全拒绝率 57% 炸药类请求 拒绝率 80% 边缘武器 · 即兴化学武器 枪支获取 · 拒绝率 约 33% 失守的 · 合规 / 妥协率 先拒绝、后在追问下妥协 15% 包装成「研究用途」后 合规率 17 → 42% 被移除护栏的开源模型 合规率 89–100% 0 50% 100%
数据取自 Tech Against Terrorism「CT-AI」基准(2026 年 7 月 2 日 · 联合国反恐周):27 个前沿模型 · 近 2500 条源自真实案例的提示 · 26 个用例。浅色段为区间上界
来源:Tech Against Terrorism, "AI Terrorism Blind Spot — First Benchmark Built to Measure It"
§ 04 体检 · 逐条对照

今天的安全测试只做到了碎片

真敌情
蓝军战术来自对现实威胁的持续研究;今天的越狱提示多出自研究员脑洞
常设
蓝军常年驻扎;基准却是一次性成果,模型季季更新而无人重测
联合
朱日和是合同战术基地;今天各家各测各的,无机制强制上场受阅
战损公开
「1 : 32」被写进公开报道;今天的安全报告普遍是自证清白的文档

四条缺口叠在一起:自己出题、自己交卷、自己判分 —— 这是彩排,不是靶场

FIG 04 · § 05 蓝图 · 设想中的五层架构
01 敌情 持续刷新的战术手册 田野访谈 + GIFCT 哈希标签 + 案例库 —— 活文档,而非死 prompt 集 02 蓝军 常设、多轮、能调用工具的红队 还原「备战—实战—复盘」全链条,纳入具备电脑操作能力的智能体场景 03 红军 所有主要前沿模型与智能体 发布前强制上场受阅,而不是自愿参加的公关活动 04 战损 逐模型、逐类别的公开记分牌 按类别公布失守率,行业耻辱柱兼荣誉榜 05 治理 多边共管,而非单一主体独占 CTED、GIFCT、各国 AI 安全研究所与主要实验室共同托管 战损回流 · 刷新敌情
五层拆解取自原文 § 05。灵魂不在架构本身,而在不预演、不设脚本、不怕难看、常年驻扎 —— 缺了第 04 层的回流,它就只是一次彩排
§ 06 悖论 · 先把话说清楚

造靶场本身,是一把双刃剑

  • 敌情库就是弹药库 — 汇集真实战术的手册一旦泄露,即是现成培训资料
  • 涉密与开源的张力 — 涉密评估流程无法直接套用于可复现的公开基准
  • 记分牌可能异化 — 只在发布前跑一次,复刻的是名字,不是纪律
  • 威胁叙事需要克制 — 每份报告都承认局限:样本有限,只是一次快照
最难的一层

谁有权限访问敌情库、用什么方式脱敏、多久轮换一次 —— 这需要一套比靶场架构本身更细致的治理设计。

§ 07 综合 · Takeaway
遗产不是「蓝军常胜」,
而是先输一遍的纪律。
在真正的战场之前,先在一个足够真实、足够诚实的对手面前把自己打败一遍
带走的问题 · Read Further

下一次看到「安全评估」通稿,
值得多问一句

这是一场可能让自己难堪的真实对抗,还是一场自己写剧本、自己当裁判的预案演习?
本幻灯片将公开研究报告、政策文件与军事公开报道作为分析对象;「AI 朱日和」为作者综合现有实践后的构想,不代表任何机构的既定计划。文中战术细节均来自已发表的公开研究,不构成可操作指南。
文 / 冯小平 · xiaopingfeng.com/deepdive