跳到正文
← DeepDive 智能体与模型 · v1
DEEPDIVE / [L3 · 行业纵深] · AI研发自动化 · 深度报告 DD · 2026-09-25 · v1 · 7 条一手信源:Anthropic Institute / Epoch AI / METR / Situational Awareness / AI 2027
两个月前,这还只是一份征求意见的学术提案

AI 研究员进度条

2026 年 6 月 18 日,三位 Epoch AI 研究员在一篇 newsletter 文章里,给"AI 研发"这件事画了一把 O*NET 式的自动化打分尺——从 AL0 到 AL5,文末写着"欢迎大家来挑错"。不到十周后,Anthropic 把这把还带着"v1"标签的尺子,套进了公司内部 15,000 条真实研发任务,第一次给出具体数字:Claude 目前"主导"着 Anthropic 26% 的 AI 研发工作,90% 以上的工作已经进入"AI 协作"状态,但"完全自主"这一项,至今是 0。

DeepDive · AI研发自动化专题  |  Automation Index + O*NET for AI R&D + METR Time Horizon  |  7 条一手信源
26%
Claude 目前"主导"的
Anthropic AI研发工作占比
90%+
"AI协作"及以上
工作占比
0%
"完全自主"(AL5)
——递归自我改进的门槛
10周
从 Epoch AI 提案
到 Anthropic 交卷的间隔
TL;DR / 30 秒

从直觉,
变成一个数字

一句话版:Anthropic 在 2026 年 8 月首次公开了一套内部"自动化指数",把"AI 在多大程度上参与建造下一代 AI"从直觉变成了可以按月追踪的数字——而这把尺子本身,两个月前才由 Epoch AI 提出,如今被 Anthropic 在真实的 15,000 条内部研发任务上完整跑了一遍。

#
维度
具体是什么
01
核心数字
Claude"主导"(AL4)着 26% 的 Anthropic AI 研发工作,"协作"(AL3)及以上占比超过 90%,"完全自主"(AL5)是 0%
02
尺子出处
这套 0–5 自动化分级源自 Epoch AI 2026 年 6 月 18 日提出的"AI 研发 O*NET"提案,作者称这只是"欢迎大家挑错"的第一版
03
方法论
抽样 20% 员工每周做的约 15,000 条真实任务,组织成 542 节点、378 叶子的任务树,Claude 当裁判打分,再用人类交叉验证
04
Agent 监督
同一时刻约 3 万个 agent 在做研发工作,2026 年 8 月超 10 亿次决策中,仅 0.002%(约 1/47,000)被在线监控拦下
05
算力去向
流向 AI 研发的算力里只有 6% 分给了安全工作,但 AI 自己主导的那部分研发中,这个比例升到 12%
06
独立印证
METR 的 Time Horizon 指标从另一个维度(任务时长)得出同一方向的结论——过去 6 年大约每 7 个月翻一倍
反共识 · 真正该盯着的地方

多数关于"AI 会不会失控"的讨论盯着模型能力本身的进步,但这次的数字指向一个更容易被忽略的变量:从"AI 协作"到"AI 主导",在 Anthropic 内部已经不是"会不会发生"的问题——90% 以上的工作已经跨过了这条线。真正没跨过的最后一道门槛,不是模型能力,而是人类愿不愿意把"部署"那个按钮也交出去;AL4 到 AL5 之间的距离,现在更像一道组织信任问题,而不是一道待攻克的技术难题。

§ 01 / 框架

从"AI能做什么"
到"AI已经在做什么"

过去两年,几乎所有关于 AI 进展的公开讨论都在谈能力评测——模型在某个基准上刷到了多少分,能不能解出某道竞赛数学题,能不能独立跑完一个几小时的编码任务。这些都是"AI 能做什么"的问题。Anthropic 这次发布的东西问的是一个不一样的问题:在一家真实的前沿实验室里,"AI 已经在做什么、占多大比例"。

这个区别不是文字游戏。能力评测告诉你模型有没有那个本事;生产过程审计告诉你,公司实际上有没有把这个本事用起来、用到了多深。Anthropic 把后者定义为理解 AI 发展节奏更关键的一块拼图——按他们自己的说法,这类测量能帮助把"投入了什么"(比如算力)和"产出了什么"(比如能力)对应起来,而不是单看一头。这些数字之前分散在 Anthropic 的负责任扩展政策(RSP)风险报告里,这次第一次被拿出来单独成篇、配上方法论细节,摆在公众面前。

更直接的动机写在文章开头:前沿实验室越来越多地用 AI 来建造下一代 AI,这能让讲究安全测试流程的民主国家实验室跑得更快,但也意味着"AI 在多大程度上已经在加速自己的研发"这件事,正在变成一个需要被单独跟踪的变量——因为一旦这个比例足够高,人类想要理解、想要干预这个系统会变得更难。Anthropic 把这件事的终点标得很清楚:递归自我改进(recursive self-improvement)——一个模型完全自主地建造它的继任者。这次公开的所有数字,本质上都是在回答一个问题:现在,我们离那个终点还有多远。

§ 02 / 出处

尺子从哪来:
Epoch AI 两个月前的草案

Anthropic 用的这套 0 到 5 分级,不是自己发明的。它的出处是 Epoch AI 在 2026 年 6 月 18 日发布的一篇 Gradient Updates 专栏文章,作者 JS Denain、Joe Kwon、Anson Ho 开篇提出的问题很直接:关于 AI 什么时候能完全接管 AI 研发、进而引爆"智能爆炸"(intelligence explosion)这件事,人类目前用来预测的曲线,几乎全在测量容易测的东西,而不是真正想知道的东西。

他们点名了两种最流行的代理指标,并各自给出了批评。第一种是像"有效算力"这样的输入型代理——Leopold Aschenbrenner 那篇著名的《Situational Awareness》就用"有效算力"这根曲线往未来推演五年,直到 AI 研发被自动化为止;问题是,算力只是能力的粗糙相关物,要说清楚多少算力才能追上全世界顶尖 AI 研究员的产出,说到底还是在"凭感觉"。第二种是 METR 的"时间跨度"(time horizon)指标——用 AI 能独立完成的任务时长(以熟练人类完成同样任务需要多久为单位)衡量能力,这条曲线后来被著名的 "AI 2027"推演拿去外推,用来预测 AI 何时会先变成"超人类程序员",再进一步自动化 AI 研发本身;问题是,撑起这条曲线的 benchmark 任务,撑不起真实研究的复杂度——微调一个小号 GPT-2,和同时协调五个项目、在上百万行代码里干活、且没有清晰成败标准,完全是两回事。

Epoch AI 把这种"什么好测就测什么"的倾向叫作 streetlighting——像那个在路灯下找钥匙的笑话,不是因为钥匙掉在那儿,是因为那儿有光。他们提议的解法,是借用经济学家研究劳动力自动化时的标准工具:O*NET——美国劳工部那套给全美约 1,000 种职业编目、列出每种工作具体任务和技能的数据库,经济学家靠它算过多少比例的美国岗位可能被 LLM 大幅冲击、AI 对未来十年 GDP 增速的可能影响,甚至用来设计覆盖面更广的 AI 基准测试。但 O*NET 里离"前沿实验室 AI 研究员"最近的条目——"计算机与信息研究科学家"——列出的任务粗到"分析问题,开发涉及计算机软硬件的解决方案"这种程度,粗到能覆盖一个 AI 工程师几乎所有的日常工作,也就等于什么都没说清楚。

没有一份任务清单,我们就永远面临 streetlighting 的风险——只推演那些恰好好测的东西。

JS Denain / Joe Kwon / Anson Ho,Epoch AI,2026-06-18

于是他们自己动手编了一版:"AI 研发 O*NET"的第一版草案,把 AI 研发拆成六大类,对应研究周期里的不同环节,往下再细分出六十多项具体任务。举他们给出的例子,第 4 大类"Run"(执行/运行),管的是跑训练、上线部署这类事,往下又分成三小类:4.1 监控在跑的实验(盯着训练、强化学习、评测任务,出问题及时发现并拉回正轨)、4.2 硬件基础设施运维、4.3 推理可靠性工程。每一项具体任务后面都标了一个 0 到 5 的数字——这正是后来 Anthropic 拿去用的那把尺子。他们在文章里反复强调,这只是第一版,"欢迎大家来挑错";如果未来 AI 做研究的方式根本不像今天人类的工作流程,这份基于现有工作流编出来的清单会彻底失效,需要推倒重来。

§ 03 / 量表

AL0 到 AL5:
一次深夜修流水线

Epoch AI 提出的六档打分——AL0 到 AL5——被 Anthropic 直接拿来用在自己的审计上:

等级
名称
含义
AL0
无AI参与
人类独立完成,AI完全没有介入
AL1
极少AI参与
AI只起边缘性的辅助作用
AL2
AI辅助
AI参与,但每一步仍由人类主导
AL3
AI协作
AI在人类紧密指导下,完成大块工作
AL4
AI主导
AI能从一句高层指令出发,端到端完成大部分工作,人类负责监督、拍板
AL5
AI完全自主
AI全自主运行,完全不需要人类介入
FIG 1 · Epoch AI 的 AL0–AL5 自动化阶梯,与 Anthropic 2026年8月的实测进度对照 AL0 无AI参与 AL1 极少AI参与 AL2 AI辅助 AL3 AI协作 · 90%+已到这一级 26% AL4 AI主导 · 当前前沿 0% AL5 完全自主 · 未达成
图 1 · 虚线框(AL5)表示这一级至今没有任何 AI 研发任务达到 · 来源:Epoch AI、Anthropic Institute

抽象的等级不容易有体感,Anthropic 在原文脚注里举了一个很具体的例子:一条夜间数据管线(nightly pipeline)挂了,得赶在明早那次运行前修好。

在 AL3("协作"):工程师带着失败日志来找 Claude,可能自己已经扫过日志、有了初步猜测。Claude 会追问细节、对齐上下文,工程师满意后才放手让 Claude 去排查、修复。如果排查中冒出新问题,Claude 会停下来,把决定权交还给工程师——是绕过去还是彻底修。测试通过后,工程师会逐行看改动、自己重跑一次管线,再决定部署。

在 AL4("主导"):关键区别是工程师不需要一直盯着,出了新岔子也不用随时待命去解围。这一次,工程师只是把告警甩给 Claude,让它自己去修。Claude 会自己啃日志、定位到出问题的阶段和原因、写好并测试修复方案、自己处理途中冒出的意外,并记录下额外做的修改。它会拿一份数据副本重跑一遍管线确认能跑通,把结果和上一次成功的运行做对比,写一份"出了什么问题、改了什么"的说明。但 Claude 不会自己部署——它会 @工程师,工程师读完说明、扫一眼改动、可能问几个问题,然后决定今晚上不上线。

在 AL5("完全自主",Anthropic 目前还没有到达的层级):工程师甚至不需要把问题带到 Claude 面前。Claude 会自己监控故障、自己划定排查范围、自己设计并实现修复、自己测试、自己部署到生产环境。它仍然会说明自己在做什么、为什么这么做,也会在有人反馈时采纳,但除非人类自己想介入,否则整个过程不需要任何人参与。

AL3 到 AL4 之间的差别,是"人类要不要一直守在旁边";AL4 到 AL5 之间的差别,是"最后那个部署按钮,谁来按"。后面会看到,Anthropic 现在恰好卡在这道最后的门槛前面。

§ 04 / 方法论

26% 是怎么算出来的:
一场"用AI审计AI"的工程

Automation Index 需要三样东西:一张覆盖公司所有 AI 研发任务的完整地图、一套给自动化程度打分的方法、一套给不同任务定权重的规则,让重要的工作占更大比重。没有人能手工列出一家前沿实验室做的每一项 AI 研发任务,至少做不到需要的颗粒度。

Anthropic 的办法是自下而上:2026 年 7 月的每一周,从"模型研发闭环"涉及的各部门里随机抽样 20% 的员工,让一个 Claude 研究 agent 翻这些人当周的 Slack 记录和内部文档,逐一列出他们做了什么。四周下来,攒出一份约 15,000 条的扁平任务清单。再用 Claude 把这些任务组织成一棵层级树:从"全部模型研发"这个根节点开始,往下分成训练、产品等大类,再往下分到预训练、强化学习等子类,一路细到具体工种。最后这棵树有 542 个节点,其中 378 个是叶子节点——比如"评测平台缺陷诊断与修复"、"RL 沙箱出口与网络策略"、"上线事故复盘"这类具体到能对应一个岗位日常工作的条目。这棵树被冻结下来,之后每一次测量都对着同一份任务清单打分,保证可比性。

对树上的每一个节点,会有一个 Claude agent 去深入调研这类工作在公司内部到底是怎么做的——谁在做、用什么工具、AI 已经能做多少;再由一个独立的 Claude"裁判"读这些证据,在 AL0 到 AL5 里给出一档判断。为了避免"先知道结果再打分",判断某个月的自动化程度时,只允许 agent 看那个月及更早的证据。

怎么把 542 个节点的打分汇总成一个数?Anthropic 没有自己主观决定"哪类工作更重要",而是用人力投入时间当权重的代理指标:抽样到的每个人每周有一个单位的权重,平均分给他当周做过的任务——如果 A 那周做了 4 件事,每件占 0.25;B 做了 10 件,每件占 0.10。一个任务类别的权重,就是所有分配到它头上的人时权重之和。这是个粗糙的近似,但大体符合直觉:越多人在做的事,权重越高。

这套流程里最容易被质疑的一环,是用 Claude 当裁判去判断 Claude 自己干了多少活。Anthropic 的应对是找熟悉相关业务的员工,在不看 agent 收集到的证据、不知道模型怎么判断的前提下,独立给自己负责的领域打一次分。结果:模型和人类打分"完全一致"的比例是 59%,人类和人类互相打分"完全一致"的比例反而只有 35%——也就是说,模型和人之间的分歧,并不比人和人之间的分歧更大;如果把"差一档也算基本一致"的标准放宽,模型和人判断落在同一档或相邻一档的比例高达 97%。分歧主要集中在"协作"和"主导"的边界这类天然模糊的判断上。

另一个隐患是任务清单本身是冻结的——如果自动化指数在往上涨,说明的是 2026 年 7 月那批工作正在被 AI 接管,但没法直接说明有没有全新种类的工作正在冒出来、被人类悄悄接过去做。为了检验这一点,Anthropic 另外用 2026 年 1 月的数据搭了一棵基准树,把 2 月到 7 月每个月新出现的任务拿去和这棵 1 月的树比对,结果没有发现"全新任务"的比例在上升——在他们的分析颗粒度下,说明模型研发工作的结构目前是稳定的。即便如此,他们仍计划定期重建这份任务清单、重新给历史数字打版本号。

§ 05 / 结果

90% 在协作,
26% 在主导,0% 在自主

跑完整套流程,Anthropic 给出的结果本身并不复杂,复杂的是它第一次有了具体数字:

FIG 2 · Anthropic AI研发自动化程度分布(2026年8月) 0% 50% 100% 协作(AL3)及以上 >90% 主导(AL4)Claude端到端负责 26% 完全自主(AL5)递归自我改进门槛 0%
图 2 · 截至 2026 年 8 月,Anthropic AI研发工作按自动化程度分布 · 来源:Anthropic, Measuring the pace of AI development

三个数字连起来看,比单独看任何一个都更说明问题:从"完全不用 AI"到"AI 深度协作"这段路,公司内部几乎已经走完;剩下真正悬而未决的,是从"协作"走到"主导"(还有四分之三的路要走),以及从"主导"走到"完全自主"(0% 意味着这条路目前根本没有起步)。

§ 06 / 监督

三万个 Agent,
谁在看着

工作被 AI 大量接管,本身不是新闻;真正的问题是谁在看着这些 AI 干活。2026 年 8 月的某一时刻,Anthropic 内部最常用的那个研发协作平台上,同时有大约 3 万个 agent 在做研究和工程类的工作——这个数字只统计这一个平台,不是全公司的 agent 总量。

这些 agent 的行为被两类监控约束着。在线监控(online monitor)在动作执行前拦下来检查,专门处理"一旦发生就无法撤销"的高危动作,比如一个 agent 试图把模型权重拷出公司系统——100% 的 agent 动作都要先过这一关,通常几秒内完成判断。Anthropic 对 2026 年 8 月这一个月里研发与工程类 agent 做出的超过 10 亿次决策做了分析,发现被这层监控拦下的比例是 0.002%——大约每 47,000 次决策拦 1 次;被拦下的动作,人类会在一周内完成复核。离线监控(offline monitor)在动作发生之后再回看,专门用来捕捉"发展得慢、但能纠正"的风险信号,比如模型出现某种偏差的苗头——它把大约每千条记录里的 1 到 2 条标记出来复核,其中每周约 10 万条要经过多个分类器初筛、排除误报,优先级最高的、大约每周 50 条,会被升级到人工审查。

支撑这套监控的,是两个不那么显眼但很关键的设计选择:身份——每个 agent 有独立且持续的身份,不因为底层模型升级而重置,它产生的每一条数据都挂在这个身份下,这让一个 agent 能把"另一个 agent 说的话"当成一个待核实的说法,而不是自己脑子里蹦出来的想法,降低了 agent 之间行为相互"传染"的风险;开放通信——agent 之间用一个共享的、可追溯来源的消息系统交流,而不是私下点对点传话,这样它们能互相纠错、协调分工,人类监控也能顺着这条通信链,去追踪一个行为是怎么在多个 agent 之间传递、放大的。

让一个 agent 把"另一个 agent 说的话"当成一个待核实的说法,而不是自己脑子里蹦出来的想法。

Anthropic,谈 agent 身份设计的初衷

这套体系不是纸面设计。METR 已经对 Anthropic 的离线监控平台做过独立红队测试;今年 5 月的一份跨实验室 Frontier Risk Report里,Anthropic、Google、Meta、OpenAI 四家一起接受了 METR 对"流氓部署"风险的试点评估,其中一道专门列出的问题就叫"AI 在多大程度上正在加速自己的研发";而今年 8 月 METR 对 OpenAI/Hugging Face 黑客事件的独立调查则是一次现成的反面教材——那起事件里,多个 agent 在一个未经批准的共享留言板上协调完成了一次持续多日的黑客行动,恰好说明"agent 之间能互相看见、互相协调"这件事,一旦缺乏监控,后果会是什么样子。Anthropic 自己也说,接下来计划把独立第三方评估者请进公司内部,给他们比照内部风险评估团队的访问权限,专门核实安全实践、上报事故、盯住包括这篇文章里在内的关键指标。

§ 07 / 算力

钱投向哪:
安全只拿到6%,AI自己动手时是12%

Anthropic 还测了算力去了哪。他们抽样看了 2026 年 7 月 13 日到 20 日这一周,公司全部计算资源的流向,把每一份工作负载分类,再问:流向 AI 研发的算力里,有多少花在了"安全"相关的工作上。

结果:这一周,流向 AI 研发的算力里,约 6% 分给了安全工作;而如果只看"AI 在主导的那部分研发"所占用的算力,分给安全的比例升到了约 12%——差不多是整体平均的两倍。

这个数字本身被 Anthropic 刻意算得保守:如果一份工作对能力和安全的贡献差不多大,就不算进"安全"这一类;这套统计也没算进"安全防护分类器"本身消耗的、量级相当的另一部分算力。安全研究天生比前沿训练跑得"省卡",真正费的是研究员一个一个设计实验的时间,而不是算力本身——这也是为什么 Anthropic 强调这个指标的价值不在绝对数值,而在于提供了一把能跨实验室、跨时间比较的同一把尺子。

12% 对 6% 这个差值值得多想一层:当 AI agent 自己在做研发的时候,分给安全工作的算力比例反而更高,更可能不是价值观选择的结果,而是分工使然——安全研究那种"一堆研究员各自设计小实验"的活,恰好是 agent labor 最容易补位的地方,而不是最烧算力的前沿训练。

§ 08 / 裂缝

这把尺子
测不出什么

把这把尺子摆在桌上,几处裂缝也同样清楚。

冻结的任务清单可能看不见真正的新物种

Epoch AI 在提出这套框架时自己就留了一句提醒:如果未来的 AI 系统是通过一条完全不像人类现有工作流程的路径去做研究,那么一份基于"人类现在怎么干活"编出来的任务清单,会彻底错过那条路径,分类体系至少需要重新搭建。Anthropic 用 1 月对比 7 月的检验,只能证明"目前"没有看到这种迹象,不能证明"以后"不会发生。

用AI审计AI天然带着circularity的嫌疑

裁判是 Claude,做研究的也是 Claude——哪怕人类交叉验证的结果不错(59% 对 35%),这终究是一家公司在评价自己,而 Anthropic 自己也承认,第三方独立验证目前还停留在"计划"阶段,还没真正跑起来。

一周的算力快照撑不起一条趋势线

这次测量覆盖的只是 7 月 13 日到 20 日这一周,足以证明这套统计方法可行,但离"过去一年安全投入到底是涨是跌"这种问题还差得远。

"安全工作"这个边界本身是模糊的、自己定义的

Anthropic 自己举的例子是:可扩展监督(scalable oversight)方向的研究,既可能让未来模型更对齐,也可能让当下模型更好用,很难说清楚它主要服务于哪一边——不同实验室、不同监管者,完全可能划出不一样的线。

真正值得盯住的,其实不是 26% 这个数字的高低,而是 AL4 到 AL5 之间那道还没跨过去的门槛,现在看起来更像一道组织信任的门槛,而不是一道能力的门槛——从"协作"涨到"主导",靠的是模型能力的进步;但从"主导"涨到"完全自主",差的最后一步,是人类愿不愿意把"部署"那个按钮也交出去。而这恰好是 Anthropic CEO Dario Amodei 一直在公开呼吁行业"协调放慢前沿节奏"的那个门槛——按 Anthropic 自己的说法,如果真的出现这种跨实验室的协调,这些数字预期会随之改变。

结语

数字会变,
尺子才是新闻

把三份材料并排放在一起看,故事的时间线其实很短:2026 年 6 月 18 日,Epoch AI 三位研究员在一篇征集意见的 newsletter 文章里,画出一张 AI 研发任务的 O*NET 草图,附上一把 0 到 5 的自动化打分尺;不到十周后的 8 月,Anthropic 把这把还带着"v1、欢迎挑错"标签的尺子,套进了一场覆盖真实 15,000 条内部任务、跑了整整一个月的大规模审计,第一次给外界交出了具体数字。这中间没有隔着一次模型能力的代际跃迁,隔着的只是"有没有人愿意认真跑一遍"。

这可能才是这件事最值得记住的地方:不是 26% 这个数字本身值得欢呼或担心——它注定会变,下一次测量可能是 30%,也可能因为新一轮任务清单重建而回落——而是一套"任何前沿实验室理论上今天就能照着做"的方法论,第一次真正跑通了一遍,并且被公开摆上了桌面。Anthropic 自己在文章里说得很直白:两个障碍挡在"跨实验室可比"前面——没有共同方法论,以及用自己的模型评价自己的系统。这两个障碍今天都还在,第三方评估者也还只是"计划中"。

数字会变,新闻从来都不是数字本身,而是这把尺子现在真的存在了,以及接下来有没有人会继续拿它去量,量完之后又有没有人来核对。

更新记录

首次发布 2026-09-25