循环 Transformer 是一个真实的工程收益,不是炒作。 字节 Seed 用严格拉齐条件的 SMELT 论文证明了它在大规模、算力受限场景下的真实收益, 三个真实产品也验证了这一点——但它同时存在最优循环次数、训练不稳定、延迟开销这三个 还没被彻底解决的老毛病。
普通 Transformer 靠堆层数变强;循环 Transformer 用一小组共享参数反复过好几遍,把"花多少算力" 和"有多少参数"这两件事彻底拆开。这原本是个省显存的工程技巧,2023 年被证明图灵完备, 过去一年从论文长出了三个真实产品。2026 年 9 月 1 日,一篇关于 OpenAI 下一代模型 Astra 的报道, 把这项技术直接推上了 AI 安全圈吵得最凶的问题:当模型的"思考"越来越多地发生在读不出来的 循环里,人类还能不能看懂它在想什么。
TL;DR · 30 秒读完
循环 Transformer 把"参数量"和"算力"拆成两个可以分别花钱的变量,过去一年从学术玩具长成了 真实产品;但它同时也是一种能让模型"思考"完全发生在读不出来的隐藏状态里的架构,2026 年 9 月 这两条线在 GPT-6 Astra 身上撞到了一起。
反共识洞察:这场恐慌里,"OpenAI 在用某种危险架构"这个具体指控目前证据最扎实;但"循环本身会自动压制可见思维链"这个更笼统的技术判断,独立研究者的冷静拆解认为并不成立——真正该盯的是算力规模效应,不是循环这个机制本身。
普通 Transformer 是"叠层"——堆 N 个参数各不相同的层,模型越深,参数越多,两件事绑死在一起。 循环 Transformer 是"打转"——用一小组共享参数反复过 N 遍,把"花多少算力"和"有多少参数"这两个 变量彻底拆开。想让模型算得更深,不用多存一份权重,只需要多转几圈。
这个思路不是凭空冒出来的。它能追溯到 Google 2019 年的 Universal Transformer (Dehghani et al.)——用循环取代固定深度,让模型能按输入难度调整计算量——以及 ALBERT 论文里 提出的跨层权重共享(用共享参数把 BERT 的存储体积砍掉一个数量级)。但这两个工作当时更多是 效率优化的旁支,没人把它当成一条主线架构去认真投入。
输入 → 第 1 层(参数 θ₁)→ 第 2 层(参数 θ₂)→ … → 第 N 层(参数 θN)→ 输出。 N 层 = N 份不同的权重,模型深度和参数量按 1:1 比例增长。
输入 → 循环块(同一份参数 θ)→ 输出反馈回输入 → 再过一遍循环块 → … 重复 R 次 → 输出。 R 次循环 = 1 份权重用 R 遍,深度(有效算力)和 参数量互相独立。
参数量决定模型能记住多少知识,循环次数决定模型愿意为一个问题花多少算力——
这两件事第一次可以分开花钱。
程序有多复杂,只体现在循环了多少次, 模型本身的参数量完全不用跟着涨。 — 《LOOPED TRANSFORMERS AS PROGRAMMABLE COMPUTERS》,GIANNOU ET AL., ICML 2023 的核心论断
真正把循环 Transformer 讲透的是 2023 年那篇奠基性论文 《Looped Transformers as Programmable Computers》 (Giannou et al., ICML 2023)。作者没有训练模型,而是手工构造出一组权重, 让一个反复循环的 13 层 Transformer 模拟出一台真正的计算机——内存读写、条件分支、函数调用全部实现, 证明这套机制图灵完备。
具体做法是把输入序列拆成三部分:scratchpad(暂存区)、memory(内存)、instructions(指令)。 Transformer 算完一轮的输出被完整喂回输入,作为下一轮循环的起点——这个反馈箭头就是整套机制的核心。 关键结论是:一个程序有多复杂,只体现在"循环了多少次",模型本身的参数量完全不用跟着涨。
这篇论文本身不是一个能用的产品,更像是一份数学存在性证明——先把"循环 Transformer 理论上能做到什么" 钉死,后面两年的工程论文才有了一个可以对照的天花板。
从"数学证明"到"能训练的架构",这两年最重要的一步是 《Mixture-of-Recursions》 (KAIST / Mila / Google DeepMind 联合团队,NeurIPS 2025)。它解决了一个此前循环 Transformer 没认真处理过的问题:早期方案给每个 token 分配同样的循环次数,但一句话里"的"、"了"这类虚词 和一个复杂的数学证明,需要的计算量根本不是一个量级。
Mixture-of-Recursions 的做法是给每个 token 单独分配循环深度: 简单的词提前退出循环,难的词留在里面多算几轮。论文里的可视化图很直观——深色格子是"这个 token 在这一层被算了",浅色格子是"跳过";同一句话里,常见虚词早早退出,需要推理的词继续留在循环里。
这篇论文是后续几乎所有 2025–2026 循环 Transformer 新论文的地基——它把"循环"从一个统一施加在 整个序列上的粗粒度开关,变成了一个可以按 token 精细调节的资源分配问题,为下一步的工程优化 打开了空间。
站在 Mixture-of-Recursions 这个地基上,2025 年底到 2026 年密集冒出一批更细的改进方向—— 有的解决"循环次数能不能推理时动态调",有的解决"循环次数一多训练就崩",还有一个完全不训练、 纯手工构造的极端案例,用来验证循环 Transformer 的理论下限。
| 论文 / 项目 | 团队 · 发表 | 核心方法 | 关键数字 |
|---|---|---|---|
| LoopFormer | ICLR 2026 | 借鉴扩散模型"shortcut 一致性"训练,循环次数变成推理时可调的"预算旋钮" | 24× 预算下困惑度 10.28,逼近 24 层固定深度基线的 9.49 |
| Fully Looped Transformer | 香港浸会大学 / 吉林大学 | 把残差连接铺进每个子层,抑制"梯度震荡 / 残差爆炸"导致的训练崩溃 | 下游任务表现最高提升 13.2% |
| LoopCoder-v2 | 北航 / IQuest Research | 跨 loop 位置偏移 + 共享 KV 门控滑窗注意力,延迟不随循环数明显增长 | 循环 2 次 SWE-bench Verified 64.4 分(不循环 43.0),3 次以上跌到 27.6 |
| Loom | 单作者 · 纯手工构造,不训练 | 470 万参数、8 层、22 条指令集的循环 Transformer"计算机" | 50 个测试 C 程序全部跑通,还能在浏览器里玩贪吃蛇和DOOM |
| Parallel Loop Transformer | 字节跳动 | Cross-Loop Parallelism:不同 token 的循环步在同一次前向里并行算,KV cache 只留第一轮 | 保住深度循环模型准确率,延迟和显存开销几乎与不循环标准 Transformer 打平 |
这五篇论文合起来讲了一个连贯的故事:LoopFormer 解决"循环次数能不能像旋钮一样调", Fully Looped Transformer 解决"循环次数一多训练会不会崩",LoopCoder-v2 用实测数据验证了 一个反直觉的结论——转得越多不等于越好,存在一个最优循环 次数,过了这个点收益会倒退——而 Loom 这个纯手工构造、完全不训练的极端案例, 则是从另一个方向印证了 §02 的图灵完备性证明:即便只有 470 万参数,只要循环次数够, 依然能跑通真实的 C 程序。Parallel Loop Transformer 处理的是工程侧最后一道坎——循环带来的 延迟和显存开销问题。
这套架构已经不只是论文里的玩具了。字节跳动 Seed 团队的 Ouro 模型,用 1.4B / 2.6B 的参数量打平了传统 4B / 8B 级别模型的表现。同一个团队(联合清华大学) 随后又补了一篇更硬核的论文 《SMELT》—— 把每 token 算力、总参数量、KV Cache 三项严格拉齐,不给循环架构任何算力优势,扩展到 54B 参数规模后,循环版本依然能比不循环的基线省下 6.8%–18.0% 的训练算力,优势在代码任务、长文本 和更多上下文样本的场景里更明显。论文给出的机制解释是:模型"重新过一遍"时会减少对无意义 token 的注意力沉积、把注意力转回真正有内容的 token 上。从"做出一个能打的产品"到"拿出一份 不作弊的学术证明",字节 Seed 这条线走得挺扎实。
南北阁实验室(隶属上市公司 BOSS 直聘 / 看准科技,不是创业公司)的 Nanbeige4.2-3B 走了同一条路——28 万亿 token 从头训练,把同一套 22 层堆栈循环两遍(等效 44 层但不用多存参数), 实测两遍循环性价比最高,能保住约 75% 的 token 效率,再多循环收益就很小了。
IQuestLab——量化基金九坤投资旗下的 AI 研究部门,和 DeepSeek 脱胎于幻方量化是同一种模式—— 发布的 IQuest-Coder-V1-40B-Loop 同样用了循环架构。这三家是目前能查到名字、查到论文的真实落地案例。网上另有文章把"循环 Transformer"包装成某种数学经济学突破,通篇是比喻和形容词,找不到一个具体实验室、一篇论文 或一组数据——这类内容更适合当背景噪音,不适合当信源。
| 模型 | 团队 | 循环配置 | 对比结果 |
|---|---|---|---|
| Ouro-1.4B / 2.6B | 字节跳动 Seed | 共享层栈循环 4 步(R4),7.7T token 训练 | MATH500 82.4 / 90.8 分,超过用 36T token(约 5 倍数据量)训练的 Qwen3-4B(59.6) / Qwen3-8B(62.3) |
| Nanbeige4.2-3B | 南北阁实验室(BOSS 直聘 / 看准科技) | 22 层循环 2 遍,等效 44 层,28 万亿 token 从头训练 | SWE-Bench Verified 63.6 分,超过参数量 3–4 倍的 Qwen3.5-9B(53.1) / Gemma4-12B(44.2) |
| IQuest-Coder-V1-40B-Loop | 九坤投资 IQuestLab | 80 层通过 40 层堆栈循环 2 遍实现 | HumanEval 97.6 分(超标准版 93.9),但 SWE-Bench Verified 69.4 分反低于标准版 71.2——生成类任务提升、长程 agentic 任务退步,官方定位为实验性原型 |
来源:各论文原文与 IQuestLab 官方发布页。
从"堆层"到"打转",循环 Transformer 唯一朴素的卖点就是把算力和参数量解耦——同样的参数预算, 能换来更深的有效计算;同样的计算预算,也能换来更小的存储体积。这在显存和部署成本都是硬约束 的场景下,是一个实打实的工程收益。
但 §04 表格里那三个"没解决"也是真的:循环次数存在一个最优点,过了这个点收益会倒退 (LoopCoder-v2 的 loop-2 optimum);循环次数一多,训练本身可能因为梯度震荡和残差爆炸直接崩掉 (Fully Looped Transformer 要专门修这个问题);循环带来的延迟和显存开销,需要 Parallel Loop Transformer 这类专门的工程方案去对冲。IQuest-Coder-V1-40B-Loop 的实测结果也提醒一件事: 循环架构不是全面碾压——生成类任务(HumanEval)提升,但 SWE-Multi、CodeArena 这类长程 agentic 任务反而退步,官方自己都把它定位成"实验性原型"。
循环 Transformer 目前更像一个"在特定场景下好用的工具",不是"通用架构的下一代"—— 字节 Seed 用严格拉齐的 SMELT 论文证明了它在大规模、算力受限场景下的真实收益, 但同一批工程社区也在密集地给它打补丁,说明这条路线离"开箱即用"还有距离。
这套省参数的技巧,很快也在回答一个更敏感的问题:AI 到底在"哪里"想问题——是写成看得懂的 思维链文字,还是转在读不出来的隐藏状态里。9 月 1 日,The Information 援引匿名信源报道, OpenAI 下一代模型 Astra 会用一种叫"循环深度"(recurrent depth)的推理技术——同一段查询在 模型里被反复处理好几遍,批评者把这种做法称为"不透明循环"(opaque recurrence),因为它比 常规思维链留下的可读痕迹更少(The Information 原文为付费墙内容,未能直接核实,此处转引自 安全研究者的公开回应)。
Redwood Research CEO Buck Shlegeris 本人在 X 上说:"我对 Astra 使用 不透明循环的报道感到极度担忧……如果 OpenAI 把这项技术进一步推进,他们将有能力大幅增加 循环强度,彻底摧毁思维链的可监控性。"
Redwood 首席科学家 Ryan Greenblatt 则说:"我最担心的是,接下来自然的 演进方向会是把不透明推理规模继续做大,做到模型几乎完全在潜空间里思考……希望现在停下还不算 太晚。"
@bshlgrs · @RyanGreenblatt,2026-09-01
OpenAI 这边的回应留了余地:报道明确说 Astra 对这项技术的使用"看起来是有限的",思维链预计 仍然可读,公司也反驳了"会转向神经语(neuralese)"这种说法;首席科学家 Jakub Pachocki 在 X 上 写道"从我们第一代推理模型开始,OpenAI 就一直在努力保留和利用思维链监控……这是我们当前研究 计划的核心目标之一"——这句话更像是重申立场,而不是正面回应"Astra 是不是真用了循环深度"这个 具体问题。
独立研究者 Sebastian Raschka 隔天写了篇更冷静的技术拆解, 观点相当扎心——他指出"重复用同一层"这件事本身并不会自动压制可见的思维链,"只是在生成下一个 token 之前,往隐藏状态里多加了一些计算,普通 Transformer 的层本来就是这么干的"。他给出的更 谨慎解读是:如果一个模型循环的遍数变多,它可能确实会需要生成更少的中间推理 token,于是更多 计算发生在读不出来的隐藏激活里——但这个效果和直接把模型做大本质上是一回事,未必是"循环"这个 机制专属的问题。换句话说,这场恐慌的一部分,可能建立在对循环 Transformer 机制本身的误解之上。 更值得注意的是,The Information 的后续报道称,Anthropic 和 Google DeepMind 也已经在讨论这项 技术——如果属实,这就不是 OpenAI 一家的选择,而是整个行业在同一个方向上试探。
这场争论没有停在猜测阶段。9 月 3 日, GPT-6 Astra 正式发布, 此前只能靠匿名信源和一句没有正面否认的回应去猜的两件事,OpenAI 这次自己全部承认了。官方博客 把它定位成"世界上最智能、最对齐的模型":FrontierMath Tier 4 跑到 98%、ARC-AGI-3 跑到 99.9%、 ExploitBench 满分,总裁 Greg Brockman 称之为"代际跃迁"。更关键的是安全那半篇——官方原话确认 Astra 是第一个跨过 Preparedness Framework "Critical" 网络安全门槛的模型;同时官方也第一次 亲口承认了"循环深度"风波里最敏感的指控——"我们的评测发现, Astra 的书面推理比 GPT-5.6 Sol 更难监控",原因是"Astra 对简单任务的书面推理控制力 更强、能用更少的书面步骤解决问题",官方把这称为"严肃对待"的问题,但也强调"它在复杂任务上 似乎仍然难以完全隐藏所需的推理过程"。首席科学家 Jakub Pachocki 这次的回应比"重申监控是核心 目标"具体得多——他给出一个可核查的技术判断:包括 Astra 在内的当前前沿系统,计算图深度仍在 GPT-4 的两倍左右,没有出现外界担心的"竞相冲向不可监控"。
网上流传更久的另一个说法——"Claude Mythos 早就在用循环 Transformer 了"——查到底,其实只是 一群人对着跑分表格连蒙带猜出来的同人考据,和 §07 的 Astra 证据分量完全不是一个量级, 不该被混为一谈。
Claude Mythos 本身是真产品——2026 年 4 月 7 日 Anthropic 官方确认 了一个受限预览版("Project Glasswing"项目,只对网络安全 / 生物安全领域的合作方开放), 目前已经迭代到 Mythos 5.1。但直接查 Anthropic 自己的 Frontier Red Team 博客文章 和产品页全文,找不到任何一句关于架构的披露——只有可用性、定价、安全防护和跑分。"循环 Transformer"这个说法的源头,是 X 上一批人对着 Mythos 的跑分模式做的非正式猜测,后来被开发者 Kye Gomez 写成了一个 PyTorch 复现项目 "OpenMythos" (GitHub 已经 14.9k 星),但这个项目自己在 README 里写得明明白白:"这是 一个独立的、社区驱动的理论重建,完全基于公开可得的研究和猜测,与 Anthropic 或其任何专有系统 没有关联、未获认可、也无从属关系。"
另外值得纠正一个常被搞反的时间线:经常和这个传闻一起被提起的 东京大学论文(Xu & Sato,《该用思维链还是该循环?》,已被 ICML 2026 录用) 其实 2025 年 5 月就挂上了 arXiv——比 Mythos 泄露(2026 年 3 月 26 日)早了大概 10 个月。不是 "这篇论文因为 Mythos 传闻才写出来",是后来编织这套理论的人反过来引用了这篇早就存在的论文, 因果关系是反的。
9 月 1 日——和 Astra 传闻同一天——Anthropic 同步发布 Fable 5.1 和 Mythos 5.1, 官方公告 写得毫不含糊:"Claude Fable 5.1 和 Claude Mythos 5.1 是同一个模型,只是防护等级不同"; 跑分差距的解释是"早期、精度较低的网络安全防护介入的任务范围,随着这次防护升级,我们预计 两个模型之间的差距会明显缩小"。这解决的是另一个问题,跟"是不是用了循环深度架构"没有直接 关系——但足以说明,"Fable 和 Mythos 到底是不是两个不同的模型"这个此前只能靠网友对着跑分 表格连蒙带猜的问题,官方给出的答案很干脆:从来就不是两个模型,只是同一份权重挂了不同等级 的安全拦截。这次发布也悄悄收紧了一道安全条款—— 官方文档证实, Fable 5.1 给 Messages API 加了新校验:"思考块"(thinking block)现在必须和产生它的 system prompt、工具、历史消息完全对得上,对不上就直接报错——堵的正是一条可能被用于规模化 蒸馏的技术路径。
Mythos 的"循环架构"传闻和 Astra 的"循环深度"报道,起点证据强度完全不在一个量级—— 但 Astra 这条这周已经走完了从传闻到官方确认的全程,Mythos 那条原地踏步。
这场争论真正的分量,来自一份更早的文件。2025 年 7 月,由 Tomek Korbak 领衔,OpenAI、 Google DeepMind、Anthropic、英国 AI 安全研究院、METR、Apollo Research、Redwood Research 等机构共 41 名研究者联署了一份立场声明 《思维链的可监控性:一个新的、脆弱的 AI 安全机会》, 提前预警了一件事——如果模型把更多"推理"放进连续的隐藏状态里循环着算,而不是生成人能读懂的 思维链文字,安全研究者观察模型"打算干什么"这件事就会失效。
今天的推理模型好歹还会把中间过程写成看得懂的文字(哪怕不完美),循环 Transformer 结构上 恰恰是反过来的——算得更省、可能更强,但过程完全不可见。Astra 风波吵的表面是"OpenAI 是不是 在用某种架构",但真正的赌注是这份预警里说的东西,是不是正在从"理论担忧"变成"正在发生的事"。
这场架构之争到这里算是有了阶段性结果:循环 Transformer 已经不只是一个省参数的工程技巧, 它已经被 OpenAI 自己确认站上了"AI 的思考过程还看不看得见"这条安全红线上——接下来该盯的 不再是"Astra 是不是用了循环深度",而是"监控能力补不补得回来"。
循环 Transformer 是一个真实的工程收益,不是炒作。 字节 Seed 用严格拉齐条件的 SMELT 论文证明了它在大规模、算力受限场景下的真实收益, 三个真实产品也验证了这一点——但它同时存在最优循环次数、训练不稳定、延迟开销这三个 还没被彻底解决的老毛病。
证据分量要分开看,不能一锅烩。 Astra 这条从匿名信源走到官方亲口承认,只用了两天;Mythos 那条从头到尾没有一手信源, 纯粹是网友对着跑分表格做的推测。把架构猜测和官方确认混为一谈,会系统性地高估或低估 真实的安全风险。
思维链可监控性不是一个抽象命题,已经有具体的 跨越门槛发生了。 41 位研究者一年前的预警,现在有了第一个被官方确认符合预警描述的 案例——OpenAI 亲口承认 Astra 的书面推理比上一代更难监控,这是"理论担忧"到"官方确认的 真实趋势"的第一次跨越。
这不是 OpenAI 一家的选择。 The Information 的后续报道称 Anthropic 和 Google DeepMind 也在讨论"循环深度"技术—— 如果属实,效率驱动和监控代价这对矛盾,会是整条前沿模型赛道接下来几年都要正面回答的 共同问题,不会随着一次发布结束。
首次发布 2026-09-04