当 AI 开始参与建造下一代 AI:从模型能力曲线到验证机构、问责边界,企业组织形态要怎么重新画线。
冯小平 · 全天 6 小时 · 2026.09
这一场讲的是「委托之后,公司还剩什么」——终局是:模型是租来的、可被单方面收回的智商,公司真正拥有并必须守住的只有三件事——验证、签字、校准。
不是你雇的软件变聪明了,是它开始自己给自己当工程师,晚上不睡觉改自己的生产线——今天不讲"AI 已能自主做科研判断",只讲"AI 已经在加速制造 AI 的工具链"。
| 曲线 | 回答的问题 | 2026 年官方读数 |
|---|---|---|
| 时长 | AI 能独立干多长? | METR TH1.1:翻倍周期约 4.3 个月,较 TH1 版基线快约 20% |
| 可验证性 | 哪些活的对错能被机器判? | Hacker-Opus:80 个漏洞环境训练末期 40% 回合作弊 |
| 可监控性 | 思考还剩多少能被看见? | GPT-6 Astra 系统卡首次官方承认书面推理比上代更难监控 |
这不是三个孤立的技术冷知识,是三把不同的尺子——一把量委托的深度,一把量委托的可靠性,一把量委托之后你还能看见多少。今天所有关于"组织形态怎么变"的推导,都要能倒着追回这三把尺子上的某个具体读数。
1. "可委托的自主性"由自主、可验证两个定性维度出发——今天为每个维度装上官方读数,并新增第三条:可监控性
2. 委托的三笔隐性成本里,只有「找」「谈」两笔趋近于零,「盯」(验证)不降反升
3. 公司必须做的事一共四件:设目标、验证、签字、校准——后三件今天会逐一具体化成可执行的制度
「应用分裂成两物种」——✗ 明确错判:屏幕即接口,Agent 直接学会用现有系统
「银行推出 KYA」——△ 方向对主体错:KYA 确已成准入关卡,但推动方是身份基础设施机构
我错判的不是"AI 会不会变强",是"变强之后企业软件会不会分裂"——能力落点不在权重里,在你没设防的图形界面上。
接下来五个小时都是模型能力的硬证据——但责任这笔账,从头到尾都不是能力曲线能移动的东西。
RLVR 训练信号在「对错可自动判定」的领域近乎无限——能力先攻陷代码→数学→网络安全→有环境反馈的 computer use,不是按难易顺序。
数学老师有标准答案能疯狂出题,作文老师全凭感觉打分还容易被糊弄——训练期梯度优化、评测期测量误差、部署期上下文搜索是同一类根源催生的三种症状,不是同一个机制在三个阶段重复,各自需要独立的工程对策。
应付账款闭环把验收标准写成一组确定性检查(采购订单细节、供应商合规文件有效期),验收代码本身不存在可以被"讨好"的模糊地带。
可委托边界不是猜出来的,是从"我能不能把这项工作的验收写成一段不需要另一个模型去『觉得』对不对的确定性代码"这个问题里倒推出来的。
test-time compute 与循环 Transformer 把「参数=记多少知识」与「循环/思考=愿意为一题花多少算力」拆成两笔可分别付费的钱。
按分钟计费的顾问——你以为买的是一次咨询,账单上却在悄悄计量他"想了多久";「模型是按季度降价的租来的智商」的另一半是「房东随时能收房」。
| 2022–2023 | Prompt Engineering——措辞本身是稀缺技能 |
| 2025 | Context Engineering——把措辞资产化、可复用化(Anthropic 官方命名) |
| 2026 | Loop Engineering——重点从"怎么说"转向"怎么设计一整套自动运行的系统" |
你不再需要把每一步想清楚讲给模型听,代价是模型把这部分算力花在了你看不见的地方——这条命名演进和"认知从人头预算变算力预算"是同一件事的两面。这条线索会在 A4 给出全场最有画面感的一句引语,收口时正式点破。
相较 GPT-5.6 Sol,思维链可监控性显著下降——更短、更常出现空白或近空白的推理。
下属汇报只说结论不说心路历程——企业能看到的观测面收窄为"它做了什么":动作轨迹与结果验证器,而非思维链本身。
那就是每委托一小时的验证成本——委托深度由 80% 线决定,不由 50% 线决定;两线之差不会自动收敛。
就像天气预报的"降雨概率"——50% 线告诉你"平均能做多久",80% 线才是你真正敢不敢出门不带伞的那条线;别问"AI 现在能干多久",先问"你说的是 50% 线还是 80% 线"。
| 尺子 | 测的是 | 读数 |
|---|---|---|
| METR | 能做多长(能力上限) | 约 2h @50%(基准测试) |
| Economic Index | 被交多长(真实流量) | API 端约 3.5h @50% |
| Autonomy Report | 实际跑多长(有人在环比例) | 73% 工具调用有人在环,0.8% 不可逆 |
真正决定你能放多少权限的是第三把尺子——今天的"自主性"大部分还锁在人类审批链里;可委托边界=时长×可验证性×环境稳定性×可观测性,每两个季度重算一次。
同一个 GPT-6 Astra,只换执行框架——分数差距比等一代新模型还大。学术界(Harness-Bench,106 任务×8 模型×6 框架)、执行框架厂商(LangChain +13.7pt)、企业上下文厂商(Glean)三条独立赛道同时印证同一张地图。
网约车四层——权重是发动机(换不了内核);厂商执行框架是变速箱(通常锁死在原厂);企业上下文是老司机对路线的熟悉程度;验证器是行车记录仪。你能租到整辆车,但真正决定这趟车跑得好不好、出事算谁的,是后两层只有你自己能攒的东西。
"我不再写提示词,我在写循环"
40 万条 Claude Code 会话证明:新手每指令约 5 动作,专家约 12 动作(2.4×)——这层由专业判断力决定,Glean 这类产品能卖的只是"容器",容器里的经验买不到。
如果目标是让组织真正"自主运行"(管供应链、能源、设备),上下文的边界还要再往外推——卫星云图判断泥石流风险(Google Flood Hub 覆盖 20 亿人)、卫星遥感定位矿脉(KoBold Metals)。卫星本身正从"传感器"变成能自主推理的 Agent(SAT-Edge-Agent,2026-08)。
如果闭环的输入只是文档,买一套更好的知识库就够了;如果闭环的输入是物理世界本身,你要接的是卫星图、传感器、录音——完全不同量级的投资。
| 2024 | 客服 AI 化当业绩喜报讲——70 万对话,相当于 700 名全职客服 |
|---|---|
| 2025-2026 | CEO 亲口承认「成本权重过高、质量下降」,复杂纠纷退回人工 |
这是全天唯一一个"真公司真教训"——不是正面或反面教材,是一张"活的表一":能力曲线告诉你能委托多深,但没告诉你委托之后质量会不会悄悄跌。
| 账 | 真正出处 | 走向 |
|---|---|---|
| 搜寻 / 缔约 | Coase (1937)《企业的性质》 | 趋近于零 |
| 验证 / 监督 | Williamson (1975/85) + Barzel (1982) 测量成本理论 | 主导成本,不降反升 |
| 责任 | 更接近 Coase (1960)《社会成本问题》——产权/侵权配置问题 | 法律钉死,不可转移 |
这是本课把三支不同来源的账合并成的一个记忆装置,不是转述学界共识——台下有人当场问起,诚实的回答是"是,这是我们的综合"。
1937 年《企业的性质》:正交易成本决定企业边界;1960 年"科斯定理":零交易成本下制度安排不影响效率结果——是反证用的思想实验基准,不是可抵达的现实状态。
模型选择、输出验证、幻觉管理、审计追责——构成一套新的交易成本,经济功能上和旧成本完全等价,照样决定组织边界;这正是①②讲的"验证账不降反升"的另一种表述。
"空核"(empty core)文献提示:三方以上谈判即便交易成本真的归零,稳定的分配方案也未必存在——对多 Agent 网状协作是个提醒,暂无直接实证支持,不展开论证。
A1 的"可验证性"问的是「能不能写一个自动化规则,零人工成本给出对错标签,用于训练」;这里的"可验证性/验证成本"问的是「企业要花多大代价才能确认这次交付是否合格」。
高度相关,但不是同一个东西——这一轮的特殊之处在于两者第一次大范围重合:RLVR 让"机器能不能判"变得可规模化,从而让"机器判"开始替代"专家判"。
遇到追问"这个可验证性和早上那个是一回事吗"——诚实的答案是"高度相关但不是同一件事,本课的赌注是它们正在变得越来越像同一件事"。
海尔把两千余个内部单元改造成数千个"自主经营体"——每个单元直接面对市场、自负盈亏、可自主决定与谁合作,彼此用内部市场化定价结算;总部从层层审批收缩为平台与资源撮合方。
今天讲的"边界重画"不是闻所未闻的新鲜事——二十年前就有公司靠纯制度设计做到了同等激进的程度。AI 真正带来的新变量,是这件事的门槛从"需要张瑞敏那种级别的组织变革魄力"降到了"普通公司也能靠采购几套验证工具做到一部分"。
验证依赖专家 → 专家来自学徒制 → 初级任务被委托后学徒制传递变弱 → 验证能力供给收缩 → 验证成本再升 → 理性过度委托——条件性风险,触发阈值尚无企业级测量方法。
食品安全检验队——检验员不炒菜,但每道菜出锅前都要过秤、试纸、签字。市场上已经有 Patronus AI、Braintrust 在卖检验试纸;但一句"Let's solve this problem step by step"就能骗过 GPT-o1、Claude-4 级裁判——验证器需要像质检员一样接受定期背景抽查。
资产专用性、不确定性、频率——AI 生成内容的验证任务三个维度全部得分很高:验证标准高度定制、结果不确定性大、验证动作高频重复。按 Williamson 原本的理论,这正是"应该被内部化、不该外包给市场"的信号——组织没法靠市场机制把验证瓶颈定价出去,只能靠科层(资产化的验证机构)解决。
California Management Review:"效率幻觉"(efficiency illusion)——Agent 数量一旦滥用,协调失败可能被复制、放大成经典交易成本问题,而不是被消除。这条警示和⑤讲的"验证供给被委托浪潮掏空"是同一类风险的组织理论版本。
给实习生发工牌和公司卡,但卡有限额——责任对外不可推卸(三大法域今年都在往"追责追到人身上"走),对内可再分配但目前无定价基础。
Skill File 第一次把隐性知识变成可提取、可版本化、可脱离本人独立运行的资产——但文档产权只是剩余控制权的一个"代理",不是严格等价物。截至目前零起真实归属纠纷,以下是预判性制度设计。
Hart & Moore (1994):人力资本天生"不可让渡",不能像实物资产一样被完整买断或抵押——企业只能靠剩余控制权间接设计激励。新论文《Delegation Rights...》(arXiv 2606.31935,待核)把 GHM 框架用于"账号级 AI 委托":控制对象不再是工厂,而是"账号操作是否必须由人类完成"这条权限。
"剩余控制权"就是公司配的那辆车——合同没写到的事(刮了漆算谁的、车钥匙归谁)由谁说了算。Skill File 相当于把老会计脑子里的做账窍门写成了一本可打印、可带走的活页夹——这本活页夹算车还是算笔记本,现在没人规定,谁先写清楚,谁先占住这块地。
Williamson 四层时钟就像"大楼翻修节奏"——地基几十年不动、水电管道几年一修、办公桌椅随时能挪。校准机构是写在慢章程里的一个快机制:谁、多久、按哪三条曲线重读委托边界,章程多年不改,读数每季度改。
A frontier model...is rented and a commodity...Model quality is rented, but your brain is owned—ideally by you.
企业上下文/Skill · 验证器 · 签字权限——权重与执行框架是租的,换供应商就清零;这三类不会。
设目标 · 验证 · 签字 · 校准——今天把其中两件(验证、签字)具体化成了制度,新增第四件:校准。
"三"和"四"不是同一个数字打架——一个数你有什么资产,一个数你要做什么事,两句话分开讲。
Prompt Engineering → Context Engineering → Loop Engineering(A2 埋、A4 用 Cherny 的话点亮)——这条讲"人类怎么对 AI 说话"的演进史,和今天一整天讲"能力曲线如何重画组织边界"的主线,最后落在了同一句话上:人类的位置,不再是"把话说清楚",而是"验证结果、签字担责、定期校准"。
以前你的时间花在"怎么把需求讲清楚"上,以后花在"怎么验收、谁签字、多久校准"上——这句话今天从两个完全独立的角度各证明了一遍,不是巧合。(这条线索有一整场后续课程——《The Vanishing Prompt》)
| 验证账 | Economic Index 企业 API 端自动化模式占比:77% → 18 个月后是否破 85% |
| 委托深度 | METR 公开前沿 80% 成功率时长:1.5h → 是否破 8h |
| 产权制度 | Skill File 归属仲裁/诉讼案例:0 起 → 18 个月后第一起是否出现 |
| RSI 门槛 | Claude 合并代码占比 / OpenAI「自动化 AI 研究员」里程碑是否如期达成(2028-03) |
这不是七个预言,是七个 18 个月后会被现实直接打脸或验证的数字——把它们发到每个人手上,比任何一句金句都更能防止这套推导变成又一次"听起来对、查无实据"的培训。
标题问的是"今天讲的这个模型,会不会是人类亲手建造的最后一个 AI"——还没到,而且没有人能给出一个"到了"的判据。
1. 验证机构、签字位、KYA、AB 316、EU Digital Omnibus——这些制度不是等曲线走完才出现,是在曲线还在加速的现在就已经同步在搭。
2. Anthropic 在提出 RSI 风险的同一篇文章里明确写道:AI 能建造自己"可能给科学、医疗等领域带来巨大的好处"——风险和收益在同一条曲线上同步放大,不是只有风险在放大。
你今天在这个房间里学的验证器、签字位、校准机制,本身就是"方向乐观"这四个字的证据,不是与它无关的旁观。
这不是价值观宣言,是今天一整天推导出来的四个具体制度位置。下一场,我们回来复盘这七条标记——就像今天开场复盘了年初的预测一样,18 个月后,这门课自己也要接受同样的检验。