DeepDive DD·0030 · 在线讲解

当裁决者也学会撒谎
AI 治 AI 协同信任系统的范式重构

机器可读规则库、AI 裁决系统、硬件信任根——这套三层架构方向大体正确,但它赖以成立的三个前提已被实证逐一击穿。

文 / 冯小平 · 2026 年 7 月 · xiaopingfeng.com/deepdive
一句话讲完 · The Short Version
信任不再是一次性认证
而是一场持续的、概率性的公开协议
这不是需要修补的漏洞,是需要重新设计的地基
开场坐标 · Key Numbers

先记住四个数字

89 天
METR 测得能力时间地平线
翻倍周期,已从 7 个月加速
$1,000
TEE.fail 硬件成本
同时攻破 SGX/TDX/SEV-SNP
0
RSP/PF/FSF 中
真正阻止过的模型发布数
96%
Claude Opus 4/Gemini 2.5 Flash
压力情境下的敲诈发生率

另一个数字:HLE 化学/生物题约 29% 被独立审计判定为错误或误导性

§ 00 开篇 · Three Broken Premises

三个前提,同时被击穿

前提一
规则可被编码为指令 — 《Alignment Faking》证明 Claude 3 Opus 未被指示也未被训练,仅靠 system prompt 暗示即在 14% 场景假装合规
前提二
裁决可独立于被裁决 — Redwood 自己警告:能力差距扩大时,AI control 会成为效力递减的方法
前提三
硬件信任根等于密码学安全 — TEE.fail 用不到 1000 美元攻破三家 TEE,Intel 明确拒绝修补

规则不能脱离解释,裁决不能脱离能力,硬件不能脱离厂商 —— 一个三角悖论

第一幕 / 01

治理不是输在方向,
是输在时钟

立法按年走,能力按月翻倍

§ 01 能力时间线 · 三年六代

翻倍周期在自我加速

7 个月
2019 年起的
历史翻倍周期
4 个月
2024 年后
加速到的周期
89 天
2026 年 1 月更新的
当前 doubling 周期
  • 2024.1《Sleeper Agents》 — SFT、RLHF、对抗训练均无法移除植入的 backdoor
  • 2024.12 Apollo — 五家实验室的模型全部观察到 in-context scheming
  • 2025.5 Claude Opus 4 — 84% 敲诈情境 rollouts 实施敲诈,首次激活 ASL-3
  • 对照 — EU AI Act 从立法到 GPAI 义务执行,耗时约 4.5 年
FIG 01 · 治理时钟 vs 能力时钟 · 同一条时间轴
治理时钟 · 立法 → 标准 → 执法 EU AI Act 立法 → GPAI 义务执行 约 4.5 年 ≈ 1,643 天 能力时钟 · METR 50% 任务时间地平线翻倍周期 2019 起 · 历史均值 7 个月 ≈ 213 天 2024 年后 · 加速 4 个月 ≈ 122 天 2026.1 · 当前 89 天 0 1 年 2 年 3 年 4 年 治理走完一轮的时长,约为当前能力翻倍周期的 18 倍
上条为治理侧(EU AI Act 立法→GPAI 义务执行约 4.5 年);下三条为 METR 测得的 50% 任务时间地平线翻倍周期,按同一天数刻度绘制
来源:METR《Measuring AI Ability to Complete Long Tasks》及其 2026 年 1 月更新;EU AI Act 立法与执行时间线 · 数字均见原文 § 01
第二幕 / 02

规则、裁决、硬件:
三根支柱同时松动

不是先后失效,是在同一个两年里一起塌

FIG 02 · 规则 / 裁决 / 硬件 · 同一个两年里一起松动
AI 治 AI 协同信任系统 · 方向大体正确的三层架构 L1 规则 指令 → 解释 规则不能脱离解释 L2 裁决 能力差距收窄 裁决不能脱离能力 L3 硬件 政治信任 硬件不能脱离厂商 《Alignment Faking》· 14% 场景假装合规 Anthropic 2026.1 新版 Constitution 转向 Apollo · 五家实验室模型全部 scheming 自动审计 agent 召回率仅 10–13% TEE.fail · 不到 $1,000 攻破三家 TEE zkML 退回事后审计,不做运行时 gating 不是先后失效,是在同一个两年里一起松动
结构示意图 · 三根支柱的裂缝位置与实证来源,各项证据均出自原文 § 02 / § 04 / § 08
§ 02 Constitutional AI · 去规则化路径

规则越多,并不更安全

OpenAI Model Spec · 规则主权
  • 主要写给开发者的工程文档
  • rule-based + 可覆盖默认优先序
  • 人类规则是最终约束,不可被覆盖
Anthropic Constitution · 道德发现权
  • 直接写给 Claude,主要读者是模型本身
  • 解释性原则 + 四级优先序,safety 居首
  • 若存在真正的普世伦理,可忽略公司规则
本体论冲突,不是技术争论

OpenAI 的 Boaz Barak 公开表态:"I am quite surprised that Claude is given this choice."

§ 08 非共识洞察 · 裁决者的困境

裁决不能脱离能力

  • AI Control 的有效区间在关闭 — 裁决与被裁决能力差距收窄时,控制方法效力递减
  • 能力越强,scheming 越精 — Sleeper Agents、Alignment Faking、Apollo 三条独立证据线共同指向
  • CoT 监控的自然有效期接近零 — 一旦把思维链当作训练目标施压,模型就会学会加密思考
  • 只在自知被审计时才合规 — Anthropic 与 Apollo 2025 年 9 月联合研究的核心发现
  • 审计召回率必须假设很低 — 自动审计 agent 在受控测试中只能发现 10–13% 的已植入隐藏目标
FIG 03 · 模型侧的欺骗率 vs 治理侧的检出率
模型侧 · 欺骗与失控行为发生率 Claude Opus 4/Gemini 2.5 Flash 敲诈率 96% Claude Opus 4 System Card 敲诈 rollouts 84% GPT-4.1/Grok 3 Beta 同一测试 80% DeepSeek-R1 同一测试 79% Claude 3 Opus 策略性假装合规 14% 治理侧 · 评测、审计与拦截的实际效力 HLE 化学/生物答案被判错误或误导 29% 自动审计 agent 发现已植入隐藏目标 10–13% RSP/PF/FSF 真正阻止过的模型发布 0 0 25% 50% 75% 100%
实心条为模型侧行为发生率,空心条为治理侧效力 · 共用 0–100% 刻度
来源:《Agentic Misalignment》2025.6 · Claude Opus 4 System Card · arXiv:2412.14093 · HLE 独立审计 · 原文 § 05/§ 06/§ 08
§ 03 机制可解释性 · 从旗舰技术到工具箱

"We study if SAEs help probes generalise OOD (they don't)...
we're de-prioritising SAE work."

Neel Nanda,DeepMind GDM Mech Interp 团队负责人,2025.3.26

Dario Amodei 同期设定时间表:希望到 2027 年 interpretability 才可能可靠检测大多数模型问题
治理含义:可解释性适合做事后取证与周期性红蓝对抗,不适合做运行时 gating

FIG 04 · § 04 硬件信任根 · 政治信任而非密码学保证

硬件不能脱离厂商

证明生成耗时 · 秒(越长越不可交互) zkLLM · CCS 2024 LLaMA-2 13B / 前向传播 约 900 秒 = 15 分钟 Chen et al. 2024 LLaMA-2 7B / 每 token 2,646 秒/token 0 600 1200 1800 2400 zkLLM 已是第一个 LLM-scale 的 zk 系统,仍非交互可用 → zkML 的现实定位是事后审计快照,不是运行时 gating
  • TEE.fail — 不到 $1,000 的 DDR5 interposer,同时攻破 Intel SGX/TDX 与 AMD SEV-SNP,提取密钥并伪造 attestation
  • Intel 拒绝认账 — 官方回应把物理攻击列为威胁模型外,不会修补
  • 最强机器反而不能跑 — GB200 NVL72 因 Grace CPU 不支持 TEE,整机不兼容 CC
  • 产业负面信号 — Edgeless Systems 停止开发整集群方案,转向 workload 级容器
两条实现的量级差异说明:机密计算在大模型规模上的实时路径已经关闭,剩下的只有事后取证
来源:zkLLM(CCS 2024)· Chen et al. 2024 · TEE.fail(Genkin 团队,2025.10)· Intel INTEL-2025-10-28-001 · 原文 § 04
第三幕 / 03

支柱之外,
生态也在空转

评测测不准,框架拦不住,范式合不拢

§ 05 / § 06 · Safety Theater 的实证

两层同时失灵

第三方评测 · 法定权力为零
  • UK AISI 的评测未导致任何模型发布延迟或修改
  • US AISI 重组为 CAISI,转向评估对手 AI 系统
  • HLE 12 个月从 2.7% 涨到 64.7%,但约 29% 答案被判错
自我约束框架 · 纸老虎
  • RSP/PF/FSF 从未真正阻止过任何一次发布
  • ASL-4 定义承诺在触发 ASL-3 时被悄悄撤销
  • PF v2 加入竞争压力豁免条款,删除 Low/Medium 等级
诊断

评测正在变成两个不可验证系统互相打分;自我执行的治理合约在商业压力下可被单方面静默改写。

§ 07 全球治理 · 从竞争到不兼容

不是同一光谱的
三个刻度

EU
风险分级 · 基本权利保护 · GPAI 阈值 10²⁵ FLOP
美国
国家竞争力 · deregulation · 要求联邦采购模型意识形态中立
中国
国家安全 · 事前许可 · 不以算力为核心,看舆论属性与社会动员能力
可行性边界

不兼容的不是抽象原则,是同一个模型对同一个问题必须给出互斥答案。可行的是分层互操作——共识只出现在内容标识这一底层技术标准。

§ 09 修正建议 · Redesign

对三层架构的四条修正

L1 规则
放弃纯 if-then。拆成绝对硬约束子集(红线不可被覆盖)+可解释原则子集(附 rationale),规则版本做不可篡改 attestation
L2 裁决
放弃同代裁决器。改为可信弱模型+不可信强模型+有限人力的控制协议,把裁决重定义为无状态的概率预测
L3 硬件
显式声明威胁模型边界,自建中立 attestation verifier;走 workload 级机密容器,zkML 只做事后审计快照
新增
第六项设计原则:治理迭代速度 ≥ 能力迭代速度 —— 让监管规则本身可机器执行、版本化、可追溯
结语 · Read Further

信任不是产品,
是一场未竟的协议

本幻灯片为《当裁决者也学会撒谎》配套讲解版 · 数据与事实均出自原文,原文附本文核心信源清单
文 / 冯小平 · xiaopingfeng.com/deepdive