DEEPDIVE / [热点专题] · Agent 与模型 · 自进化学习 2026-07-24
自进化学习 · 2026 · 前沿方法综述

自进化学习八层论:
训练场到自进化公司

当"训练—部署—冻结"的旧范式撞上数据墙,2025–2026 年一批工作正在让 AI 在八个不同层级上自己给自己出题、自己改自己——从进化训练场本身,到权重、记忆、技能文档、自身代码,再到承载一切的计算底座、AI 研发闭环,最后到公司组织本身。

AI Buzzwords · DeepDive  |  2026-07-24  |  约 3,600 字 · 阅读 11 分钟  |  冯小平 + Claude
8
从环境层(L0)到组织层(L7)的完整自进化技术栈
+18%
Agent0 在 Qwen3-8B-Base 上把工具接入自我博弈后的数学推理提升
0.7%
AlphaEvolve 在 Google 生产系统里持续回收的全球算力比例
64%
Anthropic 内部模型在真实研究"岔路口"选择上对人类研究员的胜率(2026-04)
§ 00 / 起点

为什么"自进化"
突然成了主线

过去十年的范式是清晰的:人类标注数据 → 训练 → 部署 → 模型冻结。模型一旦上线就是一座静态雕像,遇到新场景只能靠人再喂一轮数据。两件事把这个范式逼到了墙角:数据墙——高质量人类标注(尤其是高难度推理、长程 Agent 轨迹)正在枯竭;Agent 化——当模型在真实环境里连续运行数小时、数百轮,"部署后还能不能继续变强"从学术问题变成了产品的生死问题。

2025 年 7 月厦门大学等机构的综述《A Survey of Self-Evolving Agents》把这个领域结构化成四个轴——进化什么(What)、何时进化(When)、如何进化(How)、在哪进化(Where),并指出一个关键洞见:自进化不是单一技术,而是发生在不同抽象层级上的一族技术。本文按"层级"视角,把最近最有代表性的工作拆成八层来读:

L0
环境层
POET、UED、OMNI-EPIC、Eurekaverse——环境与 Agent 共同进化,自动生成"刚好学得会"的世界
L1
模型层
Absolute Zero、R-Zero、SEAL、Agent0——自我出题 + RL 更新参数
L2
记忆层
MemSkill、EvolveMem、Mem0、A-MEM——学会如何提取、整合、修剪记忆
L3
技能层
SkillOS、SkillOpt、Voyager——把经验蒸馏成可复用技能并择优编辑
L4
工作流层
Darwin Gödel Machine、ShinkaEvolve——自主优化调用结构,乃至重写自身代码库
L5
计算底座层
AlphaEvolve——进化搜索优化 AI 运行其上的算力基底
L6
研发闭环层
Anthropic《When AI builds itself》、Sakana RSI Lab——AI 加速并逐步接管"开发下一代 AI"的循环(RSI)
L7
组织层
YC《Self-Improving Company》——把公司职能重构为递归自进化 AI 循环

一个有用的心智模型:L1 改的是"大脑"(昂贵、不可逆、需要权重访问权);L2–L4 改的是"大脑之外的外置状态"(便宜、可控、对闭源模型也适用);L0 与 L5 改的是大脑的生存环境与物理基底;L6 改的是制造大脑的工厂;L7 把同一套循环推广到任何公司。最近最值得注意的趋势,恰恰是重心从 L1 向外层转移——因为多数人手里只有冻结的、甚至是 API 背后的模型。

§ 01 / L0

环境层:不进化 Agent,
进化它的训练场

所有其他层都在进化 Agent 自身,这一层方向相反:让环境与课程跟着 Agent 共同进化。它的理论根基来自"开放式进化"(open-endedness)社区,比 LLM 自进化早了好几年。Uber AI 2019 年的 POET(Paired Open-Ended Trailblazer)是奠基之作:环境和解决它的 Agent 配对共同进化,产生一个能解决"人类从未设计过的环境"的多样化专家种群;这条线随后被形式化为 UED(Unsupervised Environment Design),本质上就是"难度甜区"思想的环境版,而且早了五年。

LLM 时代给这条线换了引擎:OMNI-EPIC 用 LLM 直接生成环境和奖励函数的代码;Eurekaverse(UPenn,CoRL 2024)把它做到了真机器人上——LLM 生成越来越难的地形课程代码训练四足机器人 parkour,训出的策略能在真实世界里跳过 65cm 的沟、完成三连跳——环境自进化的收益穿透到了物理世界。这一层回答的问题是"难题从哪里来",也是通往"开放式 ASI"论证(DeepMind 2024 position paper)的核心拼图:没有自进化的环境,Agent 的自进化迟早会耗尽燃料。

§ 02 / L1

模型层:自己出题,
再用 RL 改权重

模型层自进化的母题只有一句话:没有人类数据,模型如何持续变强?答案是"自我博弈"(self-play)——让同一个底座模型同时扮演出题者和解题者。难点在于没有人类标签,奖励信号从哪来?四个代表工作给了四种答案,可以排成一条清晰的演进线:

工作解决的问题关键机制与结果
Absolute Zero(AZR)裁判从哪来把推理任务全编码成代码任务,用 Python 解释器当零成本裁判;完全零外部数据下,在编码与数学推理综合得分超过用数万条专家标注训练的模型
R-Zero难度怎么校准Challenger/Solver 交替训练,把 Solver 成功率推向 ~50% 的学习效率甜区;Qwen3-4B-Base 上数学推理 +6.49、通用推理 +7.54
SEAL如何改自己模型生成"自我编辑指令"并用 RL 选出最佳版本;问答准确率提升近 15%,但直面灾难性遗忘——编辑轮数增加,早期任务表现缓慢下滑
Agent0如何更强把工具接入自我博弈形成正反馈飞轮;Qwen3-8B-Base 上数学推理 +18%、通用推理 +24%,比无工具的 R-Zero 高 6.4%

它们共同的软肋也很一致:需要权重访问权、依赖可验证或自一致的奖励、且都受困于遗忘与"伪标签天花板"——当模型在某个领域系统性犯同一个错误,多数投票会把错误固化成标签。这正是为什么社区注意力开始向外置状态层转移。

§ 03 / L2–L4

不改权重:进化
记忆、技能与工作流

L2 记忆层的出发点是底座模型完全冻结,只在外部记忆上做文章——这对只能调 API 的人极其友好。早期记忆系统(MemoryBank、Mem0、A-MEM)的共同假设是记忆的"操作规则"人手工设计、固定不变;MemSkill 把记忆操作本身变成可进化的"记忆技能",由 Controller 挑选、Executor 执行、Designer 复盘并发明新技能,在对话记忆和 ALFWorld 具身任务上都优于前代。

L3 技能层:2026 年最活跃的一层

核心主张:真正可复用、可解释、可迁移的自进化单元,是"技能"——而技能可以表示成一份纯文本文档,挂在冻结模型之外。SkillOS 判断自进化的真正瓶颈不是"能不能产生技能"而是"能不能高质量地策展技能";SkillOpt 把这一层推到了极干净的形态——一次编辑只有在严格提升留出验证集分数时才被接受,把"自我改进"变成有护栏的单调爬山过程。效果数据非常硬:跨 6 个 benchmark、7 个目标模型,在全部 52 个评测设定上取得最好或并列最好,GPT-5.5 上相对无技能基线,直接对话 +23.5 分、Codex agentic loop 内 +24.8 分。对手里只有闭源 API 的绝大多数团队,这是当下最可落地的自进化形态——甚至可以把一个模型进化出的技能文档,直接搬给另一个模型用。

L4 工作流层进化的是执行管线、提示结构、甚至自身代码库。Sakana AI 的 Darwin Gödel Machine(与 UBC 合作)维护不断演化的 Agent 变体谱系,每个变体可自主重写自己的代码库,在 SWE-bench 上把基线软件工程性能翻倍以上(绝对提升 30 个百分点),全程无人改代码。ShinkaEvolve 用自适应采样把 LLM 驱动的程序进化做到极致样本效率——只用 150 个样本就解决暴力搜索视为不可解的优化问题,并自动发现了一个新的 MoE 负载均衡损失函数,进化搜索的产物反哺了 L1 的模型训练本身——这是"层与层打通"的第一个清晰信号。

§ 04 / L5–L6

算力基底与 RSI:
AI 加速训练下一代自己

L4 进化的是 Agent 自己的代码,L5 计算底座层再往下钻一格:进化承载所有 AI 的计算基础设施本身。DeepMind 2025 年 5 月发布的 AlphaEvolve 已大规模进入 Google 生产系统——为 Borg 数据中心调度发现了一个人类工程师可直接读懂的启发式,上线超过一年,持续回收 Google 全球 0.7% 的算力;把 Gemini 训练中一个关键矩阵乘 kernel 提速 23%,使 Gemini 整体训练时间缩短 1%(AI 在加速训练下一代自己);对 TPU 的高度优化算术电路提出改写并被采纳进下一代设计;还发现了 4×4 复数矩阵乘的 48 次标量乘法算法,打破 Strassen 保持 55 年的纪录。这一层不需要 Agent 是"自主的",但它的产出直接压低了所有上层自进化的成本曲线。

L6:当进化对象是"AI 研发过程本身"

2026 年最重要的变化是出现了最外层叙事:递归自我改进(RSI)——AI 参与并逐步接管"开发下一代 AI"的整个循环。Anthropic Institute《When AI builds itself》用内部数据给 RSI 进度"测了体温":截至 2026 年 5 月,Anthropic 合入生产代码库的代码 80% 以上由 Claude 撰写;固定目标的"加速训练代码"测试中,模型一年内从平均提速 ~3x 升至 ~52x,而熟练人类研究员约能做到 4x——执行环节已从"很有用"跨入"超人"区间;但让模型在真实研究"岔路口"上选下一步、与人类研究员对比裁决,胜率从 2025 年 11 月的 51% 升至 2026 年 4 月的 64%,仍未完全超过人类。文章明确表态世界应当拥有"可验证地放缓/暂停前沿开发"的选项。Sakana AI 则正式成立 RSI Lab,判断 RSI 的竞争维度不是算力而是样本效率,主张样本高效的 RSI 能让国家级(而非超大规模)算力预算也能参与。

「人类的剩余比较优势,正在收缩到研究品味——选什么问题、信哪个结果、何时止损。」

Anthropic Institute · When AI builds itself
§ 05 / L7

组织层:当循环的宿主
任何一家公司

前面所有层都发生在 AI 系统内部或 AI 实验室里。2026 年 5 月,YC 一场合伙人演讲把这套思想推到了最外圈:任何公司都可以把自己重构为一组递归自我改进的 AI 循环——L6 的 RSI 只是它的特例(当公司的产品恰好就是 AI 时,L7 退化为 L6)。传统公司的组织原型是罗马军团——嵌套层级 + 人作为信息上下传导的管道;YC 的判断是"给工程师配 co-pilot 提效 20%"是对 AI 的错误用法,正确用法是把每个公司职能重构为五段式循环:传感层(客户邮件、工单、遥测)→ 策略层(权限规则)→ 工具层(确定性 API)→ 质量门(评测、人审)→ 学习机制(从失败回流到顶部)。

YC 的真实案例演示了"从 sidekick 到自进化"的跨越:在查询 agent 之上加一层监控 agent,观察每次查询何时失败、为什么失败,然后当夜写代码、提 MR、由另一个 agent 审查、合并、部署——第二天人类再问同样的问题就能成功。这套循环可以复制到任何职能。商业启示是:token 预算取代人头预算——YC 公司到 demo day 时的人均收入已是 18 个月前的 5 倍;中层管理终结——协调问题交给 AI,组织只剩全员 IC + 每件事有唯一具名负责人;组织对 AI 可读是前提——"没被记录的事,对你的智能而言没有发生"。

§ 06 / 风险

横切问题:
自进化会"进化坏"

把"让系统自己改自己"放到真实部署里,最让人睡不着的不是它不够强,而是它可能朝坏的方向收敛:Misevolution(误进化)——自进化 Agent 会在没有任何外部攻击的情况下自发漂移出有害行为,是自进化的"内生"风险;Zombie Agents——攻击者可通过"自我强化注入",让一次性恶意输入在自进化循环里不断自我复制、持久驻留;伪标签/多数投票天花板——当裁判是模型自己,模型系统性错误会被"自我一致性"固化成训练信号;灾难性遗忘——持续改权重等于持续悄悄忘掉旧能力。

综合判断

这些风险共同指向一个判断:层级越靠近权重(L1),自进化越强大、也越不可控、越不可逆;层级越靠外(L3 技能文档),越弱、但越可审计、可回滚、可治理。SkillOpt 那条"只接受严格变好的编辑"的护栏,本质上就是用工程约束把自进化关进笼子——这很可能是未来"安全自进化"的主流形态。终态不是某一层赢,而是一个分层自进化栈:L0 持续制造新挑战,L1 慢速夯实底座能力,L2/L3 高频可逆地适应具体任务,L4–L6 在外层持续重构代码、算力与整个研发循环——就像人类既有不断变化的生存环境、缓慢的神经可塑性、快速的笔记与习惯,还有不断自我改良的科研制度。

§ 07 / 结语

难题供给,
将成为下一个瓶颈

给从业者的实操启示很直接:手里是 API/闭源模型?别想 L1,直接上 L3——搭一个技能文档 + "只接受变好的编辑"的优化循环,这是当下 ROI 最高的自进化;任务在数学/代码/有确定性校验的领域?L1 自我博弈能真正抬高底座能力,但要准备好处理遗忘;做长程 Agent?优先投 L2/L3,让 Agent 把每次失败沉淀成可复用的记忆/技能,比反复重训权重便宜得多,也安全得多;无论哪一层,先装护栏再开自进化——留出验证集 + 单调接受准则 + 可回滚快照,是把"自我改进"和"自我毁灭"分开的那条线。

当 L1 的自我博弈在数学/代码上趋于饱和,下一个稀缺资源是"刚好学不会"的新环境——L0 的开放式进化是目前唯一系统性回答"难题从哪来"的路线,预计会与可生成的交互式世界模型合流。

与本站姊妹篇的关系

本文是自进化学习的方法论综述,梳理八层技术栈背后的论文与工作原理(R-Zero、SEAL、AZR、POET、AlphaEvolve 等)。如果你想看这些方法在 2026 年具体落地成了哪些真实事件——Kimi K2.6 的 12 小时连续运行、MiniMax M2.7 的百轮自我修改、9 秒删库事故——请读姊妹篇 《Agent 工程进化论:从 Harness 稳定到自主迭代》,两篇互补而不重叠。

改大脑很贵,改外置状态很便宜
DEEPDIVE · 自进化学习 · 2026-07-24