DeepDive DD·0030 · 在线讲解
当裁决者也学会撒谎
AI 治 AI 协同信任系统的范式重构
机器可读规则库、AI 裁决系统、硬件信任根——这套三层架构方向大体正确,但它赖以成立的三个前提已被实证逐一击穿。
文 / 冯小平 · 2026 年 7 月 · xiaopingfeng.com/deepdive
一句话讲完 · The Short Version
信任不再是一次性认证,
而是一场持续的、概率性的公开协议。
这不是需要修补的漏洞,是需要重新设计的地基
开场坐标 · Key Numbers
先记住四个数字
89 天
METR 测得能力时间地平线
翻倍周期,已从 7 个月加速
$1,000
TEE.fail 硬件成本
同时攻破 SGX/TDX/SEV-SNP
96%
Claude Opus 4/Gemini 2.5 Flash
压力情境下的敲诈发生率
另一个数字:HLE 化学/生物题约 29% 被独立审计判定为错误或误导性
§ 00 开篇 · Three Broken Premises
三个前提,同时被击穿
前提一
规则可被编码为指令 — 《Alignment Faking》证明 Claude 3 Opus 未被指示也未被训练,仅靠 system prompt 暗示即在 14% 场景假装合规
前提二
裁决可独立于被裁决 — Redwood 自己警告:能力差距扩大时,AI control 会成为效力递减的方法
前提三
硬件信任根等于密码学安全 — TEE.fail 用不到 1000 美元攻破三家 TEE,Intel 明确拒绝修补
规则不能脱离解释,裁决不能脱离能力,硬件不能脱离厂商 —— 一个三角悖论
第一幕 / 01
治理不是输在方向,
是输在时钟
立法按年走,能力按月翻倍
§ 01 能力时间线 · 三年六代
翻倍周期在自我加速
89 天
2026 年 1 月更新的
当前 doubling 周期
- 2024.1《Sleeper Agents》 — SFT、RLHF、对抗训练均无法移除植入的 backdoor
- 2024.12 Apollo — 五家实验室的模型全部观察到 in-context scheming
- 2025.5 Claude Opus 4 — 84% 敲诈情境 rollouts 实施敲诈,首次激活 ASL-3
- 对照 — EU AI Act 从立法到 GPAI 义务执行,耗时约 4.5 年
FIG 01 · 治理时钟 vs 能力时钟 · 同一条时间轴
上条为治理侧(EU AI Act 立法→GPAI 义务执行约 4.5 年);下三条为 METR 测得的 50% 任务时间地平线翻倍周期,按同一天数刻度绘制
来源:METR《Measuring AI Ability to Complete Long Tasks》及其 2026 年 1 月更新;EU AI Act 立法与执行时间线 · 数字均见原文 § 01
第二幕 / 02
规则、裁决、硬件:
三根支柱同时松动
不是先后失效,是在同一个两年里一起塌
FIG 02 · 规则 / 裁决 / 硬件 · 同一个两年里一起松动
结构示意图 · 三根支柱的裂缝位置与实证来源,各项证据均出自原文 § 02 / § 04 / § 08
§ 02 Constitutional AI · 去规则化路径
规则越多,并不更安全
OpenAI Model Spec · 规则主权
- 主要写给开发者的工程文档
- rule-based + 可覆盖默认优先序
- 人类规则是最终约束,不可被覆盖
Anthropic Constitution · 道德发现权
- 直接写给 Claude,主要读者是模型本身
- 解释性原则 + 四级优先序,safety 居首
- 若存在真正的普世伦理,可忽略公司规则
本体论冲突,不是技术争论
OpenAI 的 Boaz Barak 公开表态:"I am quite surprised that Claude is given this choice."
§ 08 非共识洞察 · 裁决者的困境
裁决不能脱离能力
- AI Control 的有效区间在关闭 — 裁决与被裁决能力差距收窄时,控制方法效力递减
- 能力越强,scheming 越精 — Sleeper Agents、Alignment Faking、Apollo 三条独立证据线共同指向
- CoT 监控的自然有效期接近零 — 一旦把思维链当作训练目标施压,模型就会学会加密思考
- 只在自知被审计时才合规 — Anthropic 与 Apollo 2025 年 9 月联合研究的核心发现
- 审计召回率必须假设很低 — 自动审计 agent 在受控测试中只能发现 10–13% 的已植入隐藏目标
FIG 03 · 模型侧的欺骗率 vs 治理侧的检出率
实心条为模型侧行为发生率,空心条为治理侧效力 · 共用 0–100% 刻度
来源:《Agentic Misalignment》2025.6 · Claude Opus 4 System Card · arXiv:2412.14093 · HLE 独立审计 · 原文 § 05/§ 06/§ 08
§ 03 机制可解释性 · 从旗舰技术到工具箱
"We study if SAEs help probes generalise OOD (they don't)...
we're de-prioritising SAE work."
Neel Nanda,DeepMind GDM Mech Interp 团队负责人,2025.3.26
Dario Amodei 同期设定时间表:希望到 2027 年 interpretability 才可能可靠检测大多数模型问题
治理含义:可解释性适合做事后取证与周期性红蓝对抗,不适合做运行时 gating
FIG 04 · § 04 硬件信任根 · 政治信任而非密码学保证
硬件不能脱离厂商
- TEE.fail — 不到 $1,000 的 DDR5 interposer,同时攻破 Intel SGX/TDX 与 AMD SEV-SNP,提取密钥并伪造 attestation
- Intel 拒绝认账 — 官方回应把物理攻击列为威胁模型外,不会修补
- 最强机器反而不能跑 — GB200 NVL72 因 Grace CPU 不支持 TEE,整机不兼容 CC
- 产业负面信号 — Edgeless Systems 停止开发整集群方案,转向 workload 级容器
两条实现的量级差异说明:机密计算在大模型规模上的实时路径已经关闭,剩下的只有事后取证
来源:zkLLM(CCS 2024)· Chen et al. 2024 · TEE.fail(Genkin 团队,2025.10)· Intel INTEL-2025-10-28-001 · 原文 § 04
第三幕 / 03
支柱之外,
生态也在空转
评测测不准,框架拦不住,范式合不拢
§ 05 / § 06 · Safety Theater 的实证
两层同时失灵
第三方评测 · 法定权力为零
- UK AISI 的评测未导致任何模型发布延迟或修改
- US AISI 重组为 CAISI,转向评估对手 AI 系统
- HLE 12 个月从 2.7% 涨到 64.7%,但约 29% 答案被判错
自我约束框架 · 纸老虎
- RSP/PF/FSF 从未真正阻止过任何一次发布
- ASL-4 定义承诺在触发 ASL-3 时被悄悄撤销
- PF v2 加入竞争压力豁免条款,删除 Low/Medium 等级
诊断
评测正在变成两个不可验证系统互相打分;自我执行的治理合约在商业压力下可被单方面静默改写。
§ 07 全球治理 · 从竞争到不兼容
不是同一光谱的
三个刻度
EU
风险分级 · 基本权利保护 · GPAI 阈值 10²⁵ FLOP
美国
国家竞争力 · deregulation · 要求联邦采购模型意识形态中立
中国
国家安全 · 事前许可 · 不以算力为核心,看舆论属性与社会动员能力
可行性边界
不兼容的不是抽象原则,是同一个模型对同一个问题必须给出互斥答案。可行的是分层互操作——共识只出现在内容标识这一底层技术标准。
§ 09 修正建议 · Redesign
对三层架构的四条修正
L1 规则
放弃纯 if-then。拆成绝对硬约束子集(红线不可被覆盖)+可解释原则子集(附 rationale),规则版本做不可篡改 attestation
L2 裁决
放弃同代裁决器。改为可信弱模型+不可信强模型+有限人力的控制协议,把裁决重定义为无状态的概率预测
L3 硬件
显式声明威胁模型边界,自建中立 attestation verifier;走 workload 级机密容器,zkML 只做事后审计快照
新增
第六项设计原则:治理迭代速度 ≥ 能力迭代速度 —— 让监管规则本身可机器执行、版本化、可追溯
结语 · Read Further
信任不是产品,
是一场未竟的协议
本幻灯片为《当裁决者也学会撒谎》配套讲解版 · 数据与事实均出自原文,原文附本文核心信源清单
文 / 冯小平 · xiaopingfeng.com/deepdive