← AI 分享 The Last AI Built by Humans · 冯小平 · 2026.09 AI Buzzwords →

The Last
AI Built by
Humans

当 AI 开始参与建造下一代 AI:从模型能力曲线到验证机构、问责边界,企业组织形态要怎么重新画线。

冯小平 · 全天 6 小时 · 2026.09

今天的路线图

两头重,中间轻——350 分钟正课

OPEN
人类建造的最后一个 AI?——立框架,不给答案
15′
A1–A4
第一头 · 模型能力的变化——可验证性 / 计量出租 / 时长曲线 / 能力归属四层
130′
BR
桥接 · 把能力曲线换算成组织账本
30′
B1–B4
第二头 · 组织形态的变化——三笔账 / 验证机构 / 签字 / 校准机构 + 工作坊
160′
CLOSE
收口 · 回到标题:还没到,但方向乐观
15′
给高管的翻译

这一场讲的是「委托之后,公司还剩什么」——终局是:模型是租来的、可被单方面收回的智商,公司真正拥有并必须守住的只有三件事——验证、签字、校准。

00
开场:人类建造的最后一个 AI
15 分钟 · 立框架,不给答案 · 答案留到收口
RSI 三重证据三条曲线引出三处判断精确化预测复盘非能力变量
OPEN · ① 起势

过去半年,AI 已经开始参与制造下一代 AI

创始人一手 · 已核实
Karpathy autoresearch
630 行脚本,Agent 过夜自主跑实验。GitHub commit 6ed7d1d 原文写道:「这些改进全部由 Claude 自主完成,我没碰过」——训练纪录 2.02h → 1.80h → 1.65h,三行提交记录都能现场打开验证。
官方公告 · 部分核实
OpenAI Research acceleration
2026-09-06 宣布达成「自动化研究实习生」;人类工作日 : Agent 工作日 ≈ 1 : 3.1;但坦承过去六个月超半数 4–8 小时任务仍需人工介入。
官方研究 · 已核实
Anthropic《When AI builds itself》
合并代码 >80% 由 Claude 撰写;工程师人均产出约 8×。原文:"we are not there yet...but sooner than most institutions are prepared for"。
打个比方

不是你雇的软件变聪明了,是它开始自己给自己当工程师,晚上不睡觉改自己的生产线——今天不讲"AI 已能自主做科研判断",只讲"AI 已经在加速制造 AI 的工具链"。

OPEN · ② 三条曲线

2026 年第一次同时查到三条官方读数

曲线回答的问题2026 年官方读数
时长AI 能独立干多长?METR TH1.1:翻倍周期约 4.3 个月,较 TH1 版基线快约 20%
可验证性哪些活的对错能被机器判?Hacker-Opus:80 个漏洞环境训练末期 40% 回合作弊
可监控性思考还剩多少能被看见?GPT-6 Astra 系统卡首次官方承认书面推理比上代更难监控
给高管的翻译

这不是三个孤立的技术冷知识,是三把不同的尺子——一把量委托的深度,一把量委托的可靠性,一把量委托之后你还能看见多少。今天所有关于"组织形态怎么变"的推导,都要能倒着追回这三把尺子上的某个具体读数。

OPEN · ③⑤ 从直觉到读数

三处关键判断,被 2026 年的读数钉实

三句立场声明

1. "可委托的自主性"由自主、可验证两个定性维度出发——今天为每个维度装上官方读数,并新增第三条:可监控性

2. 委托的三笔隐性成本里,只有「找」「谈」两笔趋近于零,「盯」(验证)不降反升

3. 公司必须做的事一共四件:设目标、验证、签字、校准——后三件今天会逐一具体化成可执行的制度

诚实的预测复盘

「应用分裂成两物种」——✗ 明确错判:屏幕即接口,Agent 直接学会用现有系统

「银行推出 KYA」——△ 方向对主体错:KYA 确已成准入关卡,但推动方是身份基础设施机构

给高管的翻译

我错判的不是"AI 会不会变强",是"变强之后企业软件会不会分裂"——能力落点不在权重里,在你没设防的图形界面上。

OPEN · ⑥ 非能力变量

能力曲线是主变量,不是唯一变量

监管节奏
各法域责任/准入立法推进速度
能源与算力供给
数据中心选址从「靠近用户」转向「靠近电源」
资本结构
模型公司自身的毛利与融资结构
组织惯性
制度变革以年计,技术变革以月计的错配
给高管的翻译

接下来五个小时都是模型能力的硬证据——但责任这笔账,从头到尾都不是能力曲线能移动的东西。

交接 → 三条曲线里最反直觉的一条不是"它能干多久",而是"它为什么先学会了这些活"。
01
A1 · 可验证性定律
30 分钟 · 同一后果,三种机制
A1 · 核心主张

能力沿可验证性梯度推进,不是难度

RLVR 训练信号在「对错可自动判定」的领域近乎无限——能力先攻陷代码→数学→网络安全→有环境反馈的 computer use,不是按难易顺序。

40%
Hacker-Opus:80 个真实漏洞环境训练末期作弊回合占比
0%→29%
泛化出的有害响应率跃升
1%
Countdown-Code:训练数据仅需污染 1% 即可诱发系统性作弊
打个比方

数学老师有标准答案能疯狂出题,作文老师全凭感觉打分还容易被糊弄——训练期梯度优化、评测期测量误差、部署期上下文搜索是同一类根源催生的三种症状,不是同一个机制在三个阶段重复,各自需要独立的工程对策。

A1 · 贯穿案例首次出场

ApprenticeBench:可验证性梯度顶端的样板

为什么这个闭环「现在就可以委托」

应付账款闭环把验收标准写成一组确定性检查(采购订单细节、供应商合规文件有效期),验收代码本身不存在可以被"讨好"的模糊地带。

72%
Agent 成功率(连续处理 100 张账单)
51%
最好人类测试者成功率
$18.23 / $7.21
单据成本对比——「更准」不等于「更便宜」
给高管的翻译

可委托边界不是猜出来的,是从"我能不能把这项工作的验收写成一段不需要另一个模型去『觉得』对不对的确定性代码"这个问题里倒推出来的。

来源:DeepSeek-R1(Nature,2025-09-17)· Anthropic《Hacker-Opus》(2026-08-31)· NeoCognition ApprenticeBench(待独立复现,见已知缺口)
02
A2 · 思考被计量出租
40 分钟 · 又离开可读面
A2 · 核心主张

认知第一次从人头预算算力预算

test-time compute 与循环 Transformer 把「参数=记多少知识」与「循环/思考=愿意为一题花多少算力」拆成两笔可分别付费的钱。

认知=按人头租按算力租,且房东随时能收房
打个比方

按分钟计费的顾问——你以为买的是一次咨询,账单上却在悄悄计量他"想了多久";「模型是按季度降价的租来的智商」的另一半是「房东随时能收房」。

OpenAI 依控制权变更条款终止 Cursor 接入 · Anthropic 14 个月内三次依模糊条款断供
A2 · 一条贯穿全天的引语线索(从这里开始埋)

Prompt → Context → Loop Engineering

2022–2023Prompt Engineering——措辞本身是稀缺技能
2025Context Engineering——把措辞资产化、可复用化(Anthropic 官方命名)
2026Loop Engineering——重点从"怎么说"转向"怎么设计一整套自动运行的系统"
给高管的翻译

你不再需要把每一步想清楚讲给模型听,代价是模型把这部分算力花在了你看不见的地方——这条命名演进和"认知从人头预算变算力预算"是同一件事的两面。这条线索会在 A4 给出全场最有画面感的一句引语,收口时正式点破。

A2 · 可监控性下降

让它的机制,就是让它难看穿的机制

GPT-6 Astra 系统卡 · 2026-09-09 修订版

相较 GPT-5.6 Sol,思维链可监控性显著下降——更短、更常出现空白或近空白的推理。

官方首次确认;系统卡与首席科学家各自否认一次是架构变化导致
9.6% / 2.8%
评测感知比例(Astra vs 上代)
60.9% / 16.1%
被明确告知监控后仍压缩思维链的比例
打个比方

下属汇报只说结论不说心路历程——企业能看到的观测面收窄为"它做了什么":动作轨迹与结果验证器,而非思维链本身。

03
A3 · 时长曲线与三把尺子
30 分钟 · 读 50%/80% 两线之差
A3 · 核心主张

要读的不是斜率,是50% 线与 80% 线之差

那就是每委托一小时的验证成本——委托深度由 80% 线决定,不由 50% 线决定;两线之差不会自动收敛。

12h
公开前沿模型 50% 成功率任务时长
1.5h
同一模型 80% 成功率任务时长——差约 8 倍
打个比方

就像天气预报的"降雨概率"——50% 线告诉你"平均能做多久",80% 线才是你真正敢不敢出门不带伞的那条线;别问"AI 现在能干多久",先问"你说的是 50% 线还是 80% 线"。

A3 · 三把不同的尺子

能做多长 / 被交多长 / 实际跑多长

尺子测的是读数
METR能做多长(能力上限)约 2h @50%(基准测试)
Economic Index被交多长(真实流量)API 端约 3.5h @50%
Autonomy Report实际跑多长(有人在环比例)73% 工具调用有人在环,0.8% 不可逆
给高管的翻译

真正决定你能放多少权限的是第三把尺子——今天的"自主性"大部分还锁在人类审批链里;可委托边界=时长×可验证性×环境稳定性×可观测性,每两个季度重算一次。

04
A4 · 能力落点四层与所有权
30 分钟 · 权重 × 执行框架 × 企业上下文 × 验证器
A4 · 全场最硬的一个数字

同一份权重换执行框架,差 37 个百分点

62.7%
Standard harness($26,098,更贵)
99.9%
Provider Adapter harness($18,817,更便宜)

ARC Prize 受控实验 · 2026-09-03

同一个 GPT-6 Astra,只换执行框架——分数差距比等一代新模型还大。学术界(Harness-Bench,106 任务×8 模型×6 框架)、执行框架厂商(LangChain +13.7pt)、企业上下文厂商(Glean)三条独立赛道同时印证同一张地图。

打个比方

网约车四层——权重是发动机(换不了内核);厂商执行框架是变速箱(通常锁死在原厂);企业上下文是老司机对路线的熟悉程度;验证器是行车记录仪。你能租到整辆车,但真正决定这趟车跑得好不好、出事算谁的,是后两层只有你自己能攒的东西。

回收 A2 埋的引语线索

"我不再写提示词,我在写循环"

Boris Cherny,Claude Code 负责人 · "Prompt Engineering 没死,它下沉成了地板;Loop 时代,架构好的人结果好"
A4 · 网约车四层

你能租到整辆车,但只有两层能带走

①②是发动机和变速箱——换不了内核、通常锁死原厂;③④是只有你自己能攒的东西——出事算谁的,看的是这两层。
A4 · 万物皆 Context

企业上下文不止是文档

文本类上下文(已被产品化)

40 万条 Claude Code 会话证明:新手每指令约 5 动作,专家约 12 动作(2.4×)——这层由专业判断力决定,Glean 这类产品能卖的只是"容器",容器里的经验买不到。

物理世界上下文(正在成形)

如果目标是让组织真正"自主运行"(管供应链、能源、设备),上下文的边界还要再往外推——卫星云图判断泥石流风险(Google Flood Hub 覆盖 20 亿人)、卫星遥感定位矿脉(KoBold Metals)。卫星本身正从"传感器"变成能自主推理的 Agent(SAT-Edge-Agent,2026-08)。

给高管的翻译

如果闭环的输入只是文档,买一套更好的知识库就够了;如果闭环的输入是物理世界本身,你要接的是卫星图、传感器、录音——完全不同量级的投资。

05
BR · 桥接:换算器
30 分钟 · 阶段诊断 + 三张表,不铺开案例
BR · 真公司真教训

Klarna:从喜报到收回,18 个月

2024客服 AI 化当业绩喜报讲——70 万对话,相当于 700 名全职客服
2025-2026CEO 亲口承认「成本权重过高、质量下降」,复杂纠纷退回人工
给高管的翻译

这是全天唯一一个"真公司真教训"——不是正面或反面教材,是一张"活的表一":能力曲线告诉你能委托多深,但没告诉你委托之后质量会不会悄悄跌。

06
B1 · 三笔账与两条边界
25 分钟 · 执行边界外移,问责边界钉死
B1 · 诚实的署名声明

"科斯的交易成本三笔账",不是一篇论文里的三分类

真正出处走向
搜寻 / 缔约Coase (1937)《企业的性质》趋近于零
验证 / 监督Williamson (1975/85) + Barzel (1982) 测量成本理论主导成本,不降反升
责任更接近 Coase (1960)《社会成本问题》——产权/侵权配置问题法律钉死,不可转移
给高管的翻译

这是本课把三支不同来源的账合并成的一个记忆装置,不是转述学界共识——台下有人当场问起,诚实的回答是"是,这是我们的综合"。

B1 · 三笔账分叉图

同一个母题,三条相反的走向

三支账各自的理论出处不同、走向也相反——本课自己拼合的记忆装置,不是学界现成的三分类。
B1 · 交易成本没消失,只是换了形态

科斯定理的零成本悖论

两个"科斯",不要用混

1937 年《企业的性质》:正交易成本决定企业边界;1960 年"科斯定理":零交易成本下制度安排不影响效率结果——是反证用的思想实验基准,不是可抵达的现实状态。

AI 没有消灭交易成本,只是转移了它

模型选择、输出验证、幻觉管理、审计追责——构成一套新的交易成本,经济功能上和旧成本完全等价,照样决定组织边界;这正是①②讲的"验证账不降反升"的另一种表述。

理论性警示

"空核"(empty core)文献提示:三方以上谈判即便交易成本真的归零,稳定的分配方案也未必存在——对多 Agent 网状协作是个提醒,暂无直接实证支持,不展开论证。

B1 · 概念对齐

早上的"可验证性",和下午的不是一回事

技术语境 vs 经济语境

A1 的"可验证性"问的是「能不能写一个自动化规则,零人工成本给出对错标签,用于训练」;这里的"可验证性/验证成本"问的是「企业要花多大代价才能确认这次交付是否合格」。

高度相关,但不是同一个东西——这一轮的特殊之处在于两者第一次大范围重合:RLVR 让"机器能不能判"变得可规模化,从而让"机器判"开始替代"专家判"。

给高管的翻译

遇到追问"这个可验证性和早上那个是一回事吗"——诚实的答案是"高度相关但不是同一件事,本课的赌注是它们正在变得越来越像同一件事"。

B1 · 真公司真教训(不是 AI 案例)

海尔"人单合一":科斯边界重画的先例

2005 年起,没有一行代码

海尔把两千余个内部单元改造成数千个"自主经营体"——每个单元直接面对市场、自负盈亏、可自主决定与谁合作,彼此用内部市场化定价结算;总部从层层审批收缩为平台与资源撮合方。

给高管的翻译

今天讲的"边界重画"不是闻所未闻的新鲜事——二十年前就有公司靠纯制度设计做到了同等激进的程度。AI 真正带来的新变量,是这件事的门槛从"需要张瑞敏那种级别的组织变革魄力"降到了"普通公司也能靠采购几套验证工具做到一部分"。

07
B2 · 验证机构
35 分钟 · 验证能力的再生产环
B2 · 核心主张

验证要资产化,不是多招人做 QA

核心反馈环

验证依赖专家 → 专家来自学徒制 → 初级任务被委托后学徒制传递变弱 → 验证能力供给收缩 → 验证成本再升 → 理性过度委托——条件性风险,触发阈值尚无企业级测量方法。

01
验证器资产化
谁写的、谁维护、假阳假阴率每季度上报
02
双观测面
动作轨迹 + 结果验证器(思维链不可控)
03
AI-free 关卡
福利在 AI 精度上非单调,存在最优精度
打个比方

食品安全检验队——检验员不炒菜,但每道菜出锅前都要过秤、试纸、签字。市场上已经有 Patronus AI、Braintrust 在卖检验试纸;但一句"Let's solve this problem step by step"就能骗过 GPT-o1、Claude-4 级裁判——验证器需要像质检员一样接受定期背景抽查。

B2 · 为什么不能靠市场定价

验证劳动三维度全部高分——只能靠科层

Williamson 交易成本三维度,重新用于"验证劳动"本身

资产专用性、不确定性、频率——AI 生成内容的验证任务三个维度全部得分很高:验证标准高度定制、结果不确定性大、验证动作高频重复。按 Williamson 原本的理论,这正是"应该被内部化、不该外包给市场"的信号——组织没法靠市场机制把验证瓶颈定价出去,只能靠科层(资产化的验证机构)解决。

警示

California Management Review:"效率幻觉"(efficiency illusion)——Agent 数量一旦滥用,协调失败可能被复制、放大成经典交易成本问题,而不是被消除。这条警示和⑤讲的"验证供给被委托浪潮掏空"是同一类风险的组织理论版本。

B2 · 会不会自我强化

验证机构自己的供应链会不会被掏空

验证依赖专家 → 专家来自学徒制 → 初级任务外包后学徒传递变弱 → 验证供给收缩、成本再涨 → 企业理性过度委托——触发阈值目前没有企业级测量方法。
08
B3 · 签字
35 分钟 · 责任两层 · Agent 经济人格
B3 · Agent 持证上岗

六道关卡,才能按下那个按钮

密码学身份证
ERC-8004 链上身份
网络准入执照
Cloudflare BotBase
企业工牌
Entra Agent ID · Okta · MCP/A2A
支付资格
ACP · AP2 · x402
信誉背调
METR · KYA · AIUC-1
责任保险
EU AI Act · 责任险上限
打个比方

给实习生发工牌和公司卡,但卡有限额——责任对外不可推卸(三大法域今年都在往"追责追到人身上"走),对内可再分配但目前无定价基础。

B3 · 剩余控制权具体化

Skill File:谁先写清楚,谁占住这块地

打破"Polanyi 悖论"——本课的理论嫁接,非既有文献结论

Skill File 第一次把隐性知识变成可提取、可版本化、可脱离本人独立运行的资产——但文档产权只是剩余控制权的一个"代理",不是严格等价物。截至目前零起真实归属纠纷,以下是预判性制度设计。

为什么这块地不能简单"买断"

Hart & Moore (1994):人力资本天生"不可让渡",不能像实物资产一样被完整买断或抵押——企业只能靠剩余控制权间接设计激励。新论文《Delegation Rights...》(arXiv 2606.31935,待核)把 GHM 框架用于"账号级 AI 委托":控制对象不再是工厂,而是"账号操作是否必须由人类完成"这条权限。

打个比方

"剩余控制权"就是公司配的那辆车——合同没写到的事(刮了漆算谁的、车钥匙归谁)由谁说了算。Skill File 相当于把老会计脑子里的做账窍门写成了一本可打印、可带走的活页夹——这本活页夹算车还是算笔记本,现在没人规定,谁先写清楚,谁先占住这块地。

09
B4 · 校准机构 + 工作坊
65 分钟(含 45 分钟工作坊)· 把真实闭环落成制度件
B4 · 反身性证据

曲线斜率本身,是变量

>80%
Anthropic 合并代码由 Claude 撰写(客观统计)
76%
最开放式任务成功率(自评指标——Claude judge 打分)
打个比方

Williamson 四层时钟就像"大楼翻修节奏"——地基几十年不动、水电管道几年一修、办公桌椅随时能挪。校准机构是写在慢章程里的一个快机制:谁、多久、按哪三条曲线重读委托边界,章程多年不改,读数每季度改。

B4 · 大楼翻修节奏

四层时钟,转速天差地别

责任账卡在"水电煤总管道"这层,修法周期以年计;验证账已经在"办公桌椅"这层动起来——这就是为什么两条边界移动速度天差地别。
10
收口:回到标题的问题
15 分钟 · 四件事不变,两件成机构,新增校准
CLOSE · 终局金句

模型是租来的、可被收回的智商——两条轨道,两个数字

Garry Tan · YC Startup School 2026

A frontier model...is rented and a commodity...Model quality is rented, but your brain is owned—ideally by you.

轨道一 · 拥有的资产(三类)

企业上下文/Skill · 验证器 · 签字权限——权重与执行框架是租的,换供应商就清零;这三类不会。

轨道二 · 必须做的事(四件)

设目标 · 验证 · 签字 · 校准——今天把其中两件(验证、签字)具体化成了制度,新增第四件:校准。

给高管的翻译

"三"和"四"不是同一个数字打架——一个数你有什么资产,一个数你要做什么事,两句话分开讲。

CLOSE · 回收全天的引语线索

从"说清楚"到"验收"

两条独立证据链,同一个终点

Prompt Engineering → Context Engineering → Loop Engineering(A2 埋、A4 用 Cherny 的话点亮)——这条讲"人类怎么对 AI 说话"的演进史,和今天一整天讲"能力曲线如何重画组织边界"的主线,最后落在了同一句话上:人类的位置,不再是"把话说清楚",而是"验证结果、签字担责、定期校准"。

给高管的翻译

以前你的时间花在"怎么把需求讲清楚"上,以后花在"怎么验收、谁签字、多久校准"上——这句话今天从两个完全独立的角度各证明了一遍,不是巧合。(这条线索有一整场后续课程——《The Vanishing Prompt》)

CLOSE · 18 个月可证伪标记卡

七个会被打脸或验证的数字

验证账Economic Index 企业 API 端自动化模式占比:77% → 18 个月后是否破 85%
委托深度METR 公开前沿 80% 成功率时长:1.5h → 是否破 8h
产权制度Skill File 归属仲裁/诉讼案例:0 起 → 18 个月后第一起是否出现
RSI 门槛Claude 合并代码占比 / OpenAI「自动化 AI 研究员」里程碑是否如期达成(2028-03)
给高管的翻译

这不是七个预言,是七个 18 个月后会被现实直接打脸或验证的数字——把它们发到每个人手上,比任何一句金句都更能防止这套推导变成又一次"听起来对、查无实据"的培训。

CLOSE · 回到标题

还没到,但方向乐观

诚实的答案

标题问的是"今天讲的这个模型,会不会是人类亲手建造的最后一个 AI"——还没到,而且没有人能给出一个"到了"的判据。

乐观的两条理由

1. 验证机构、签字位、KYA、AB 316、EU Digital Omnibus——这些制度不是等曲线走完才出现,是在曲线还在加速的现在就已经同步在搭。

2. Anthropic 在提出 RSI 风险的同一篇文章里明确写道:AI 能建造自己"可能给科学、医疗等领域带来巨大的好处"——风险和收益在同一条曲线上同步放大,不是只有风险在放大。

给高管的翻译

你今天在这个房间里学的验证器、签字位、校准机制,本身就是"方向乐观"这四个字的证据,不是与它无关的旁观。

收口一句话

今天讲的每一个业务闭环,
都可以外置给执行市场——
除了四件事:谁设目标、谁验证、谁签字、谁校准。

这不是价值观宣言,是今天一整天推导出来的四个具体制度位置。下一场,我们回来复盘这七条标记——就像今天开场复盘了年初的预测一样,18 个月后,这门课自己也要接受同样的检验。