一、什么是 Looped Transformer?

普通 Transformer 的一次前向传播中,每层参数只被使用一次;而 Looped Transformer(循环 Transformer)会把同一组参数重复使用多次。 所有这些「循环」的玩法,都归于 recurrent depth 这个范畴:

图片

  1. 整模型循环(model-loop):把整个模型的输出隐状态重新作为输入喂回去——最经典的范式;

  2. 层块循环(block-loop):只循环中间某一段连续的层;

  3. 逐层循环(layer-loop):每一层先各自循环几次再往下走——2607.16051(Loopie)的实验发现这种方式扩展性更好;

  4. 潜变量条件化:用某种潜在输出作为后续循环的条件。

Recurrent Depth 架构示意

Recurrent Depth 架构示意

最关键的一点:循环结构是固定的、预先配置好的——每个 token 获得完全相同的计算量。这与「想多久算多久」的自适应计算形成对照。

二、一切的源头:Universal Transformers

图片

Universal Transformer(UT)是一种「时间上并行、自注意力 + 循环」的序列模型,可以看作 Transformer 的推广:它把 Transformer 的可并行性、全局感受野,与 RNN 的**循环归纳偏置(recurrent inductive bias)**结合起来——同一组参数在时间步(深度方向)上反复应用。

Universal Transformer 结构图

Universal Transformer 结构图

UT 还引入了 ACT(Adaptive Computation Time)机制,允许每个位置「思考」不同的步数。在当年的 bAbI 问答、LAMBADA 语言建模、WMT14 英德翻译等任务上,UT 都取得了领先或极具竞争力的成绩。

为什么它重要:UT 是第一个系统性地把「同一层参数反复应用」作为核心机制的 Transformer 变体。今天 recurrent depth 的所有工作,思想源头都可以追溯到这里。

三、定名之作:Scaling up Test-Time Compute with Latent Reasoning

图片

如果说 UT 是思想源头,那么这篇 2025 年 2 月的论文就是直接命名了「recurrent depth」概念、并第一个把它做到现代规模的工作。The Information 报道中 Astra 使用的技术,名字正出自这里。

3.1 核心思想:在潜在空间里「想」,而不是在文字里「说」

主流推理模型(o 系列、R1 系列)靠生成更多 token 来扩展测试时计算——思维链越长,算得越多。这篇论文走了一条完全不同的路:通过迭代一个循环块,在测试时把网络「展开」到任意深度,让模型在潜在空间中隐式推理。

这带来几个独特优势:不需要任何 CoT 专项训练数据;可以在很小的上下文窗口下工作;而且能捕捉难以用语言表达的思维类型

不同循环深度下的性能

不同循环深度下的性能

3.2 怎么训练的?

  • 架构即第一节的三段式:Prelude → 共享循环块 R → Coda,带输入注入和残差连接;

  • 训练时随机采样循环次数(用 log-normal Poisson 分布),让模型对任意循环深度都鲁棒;

  • 规模:3.5B 参数、800B token 的预训练——这在学术资源下是相当大的手笔。

3.3 效果:3.5B 打出 50B 的等效表现

作者最关键的主张是:随着测试时循环次数增加,模型性能持续提升,最高可达到约 50B 参数模型的等效计算水平——而物化参数只有 3.5B。

性能随测试时循环次数增长

性能随测试时循环次数增长

和同训练配置、同数据的非循环基线对比(下表),差距是碾压性的:同样 0.8T token 训练,循环模型在 r=32 时 ARC-E 拿到 69.91(基线 46.42)、HellaSwag 65.21(基线 37.34)、GSM8K CoT 从几乎为 0 提升到 34.80/42.08。

循环 vs 非循环基线对比

循环 vs 非循环基线对比

3.4 最迷人的部分:潜在空间里到底发生了什么?

这篇论文最有「科幻感」的贡献,是对潜在空间动力学的可视化分析。作者发现模型在循环中展现出了可识别的、类似「思考」的几何结构

数学问题中的潜在空间轨迹

数学问题中的潜在空间轨迹

四、免训练玩法:Training-Free Looped Transformers

图片

前面的工作都要从头训练循环结构,这篇论文问了一个非常实用的问题:已经训练好的开源模型,能不能直接在推理时「套个循环外壳」就变强? 答案是:可以,但姿势很重要。

免训练循环包装器

免训练循环包装器

4.1 关键洞察:把 Transformer 块看作 ODE 的一步

朴素地把层块原样循环通常会掉点。突破口来自一个数学视角——pre-norm Transformer 块可以看作某个 ODE 上的前向欧拉步(forward Euler step)。于是「循环」不应是简单重复,而应是把「一个大步」换成「多个阻尼小步」,即对同一个数值近似的精细化(Runge-Kutta 风格)。

RK 积分 vs 朴素循环

RK 积分 vs 朴素循环

4.2 效果:7 个模型家族全面验证

在 7 个模型家族(稠密、稀疏 MoE、MLA+MoE)上做了开箱即用的验证,没有逐格调参

各基准上的提升

各基准上的提升

从结果表看,提升覆盖面相当广:Qwen3-4B-Instruct MMLU-Pro 从 0.5714 → 0.5979(+2.64pp)、GPQA-Main +2.01pp;Llama-3.2 系列、Qwen1.5-MoE、Moonlight-16B-A3B、DeepSeek-V2-Lite 等也普遍有 0.7~2.3 个百分点的提升。

主要结果表

主要结果表

论文还给出了一套实用的「配方」发现:循环窗口 n=4 是甜点,n≥6 会出现性能悬崖。这篇论文的意义在于:循环深度不再是大厂的专利,任何人都可以在今天已有的开源模型上免费蹭到一波提升。

五、重要的泼冷水:LoopCoder-v2 发现「循环两次就够了」

图片

如果说前面的论文都在说「循环真香」,这篇论文则贡献了本方向最重要的反直觉发现循环不是越多越好,两次就是最优,三次以上反而回退。 这也是科普推文中「looping more than two times actually led to regressions」的出处。

5.1 工程创新:并行循环 Transformer(PLT)

顺序循环有个致命缺点:延迟和 KV cache 随循环次数线性增长。作者提出的 PLT(Parallel Loop Transformer)通过跨循环位置偏移(CLP)共享 KV 的门控滑窗注意力,让延迟和 KV 内存都近似常数,从而把「循环几次」变成一个可以自由研究的实验变量。

并行循环 Transformer(arXiv:2606.18023, Figure 1)

并行循环 Transformer(arXiv:2606.18023, Figure 1)

5.2 主实验:18T token 从头训练 7B 代码模型

作者用相同的配方从头训练了不同循环次数的 7B PLT 代码模型家族(18T token 预训练 + 对齐的指令微调),结果非常戏剧性:

主要结果(arXiv:2606.18023, Table 2)

主要结果(arXiv:2606.18023, Table 2)

5.3 为什么第三次循环反而有害?

诊断分析给出了清晰的机制解释:

各循环的贡献分解(arXiv:2606.18023, Figure 7)

各循环的贡献分解(arXiv:2606.18023, Figure 7)

这个「强烈的非单调循环次数效应」是整个领域必须面对的约束。值得玩味的是:如果 Astra 真的用了 recurrent depth,OpenAI 大概率已经找到了绕过这个「两次就饱和」瓶颈的办法——否则无法解释 Astra 展现出的那种断崖式领先。至于是什么办法,恐怕就是 OpenAI 不愿写在发布页里的部分了。

六、规模化验证:Loop the Loopies!

图片

这是 5 篇论文中最「工程硬核」的一篇,它正面回应了循环架构面临的最大质疑:

给定 N 倍的预训练计算量,直接把参数量扩大 N 倍,通常比把模型循环 N 次更划算。

如果这个质疑成立,循环深度就永远只是学术玩具。Loopie 的任务就是打破这个魔咒

6.1 Layer-loop:更好的循环粒度

系统对比了不同循环粒度的扩展性,发现逐层循环(layer-loop)比整模型循环(model-loop)扩展性更好——这正是科普推文引用的结论。

Layer-loop vs Model-loop 扩展性

Layer-loop vs Model-loop 扩展性

6.2 Loopie 系列:20B-A2B 与 6B-A0.6B

Loopie 发布了两个 MoE 模型:20B 总参/2B 激活 和 6B 总参/0.6B 激活。大量消融实验(包括与一个 vanilla 30B-A3B 模型的对照)表明:在相同计算预算下,Loopie 显著超越普通 Transformer 基线

Loopie 主结果

Loopie 主结果

配合作者提出的新型后训练方法(SPT,Supervised Pre-training),Loopie 发展出了强推理能力。与同量级 MoE 推理模型的对比相当有说服力:

与同级 MoE 推理模型对比

与同级 MoE 推理模型对比

这篇论文的信号非常明确:循环深度已经跨过了「学术玩具 → 可规模化训练范式」的临界点。 时间点也很微妙——论文 7 月挂出,Astra 9 月发布。

<span leaf="">1. Universal Transformers https://arxiv.org/abs/1807.03819</span><span leaf=""><br></span><span leaf="">2. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach https://arxiv.org/abs/2502.05171</span><span leaf=""><br></span><span leaf="">3. Training-Free Looped Transformers https://arxiv.org/abs/2605.23872</span><span leaf=""><br></span><span leaf="">4. LoopCoder-v2: Only Loop Once&nbsp;</span><span><span leaf="">for</span></span><span leaf="">&nbsp;Efficient Test-Time Computation Scaling &nbsp;https://arxiv.org/abs/2606.18023&nbsp;</span><span leaf=""><br></span><span leaf="">5.Loop the Loopies! https://arxiv.org/abs/2607.16051</span><span leaf=""><br></span><span leaf="">6. OpenAI. _GPT-6 Astra &nbsp;https://openai.com/index/gpt-6-astra/=</span><span leaf=""><br></span><span leaf="">7. Stephanie Palazzolo (The Information). _Secret Technique Behind OpenAI’s Astra Model Sparks Security Concerns_. 2026-09-02.</span><span leaf=""><br></span><span leaf="">8.https://x.com/kimmonismus/status/2095045887131087357</span><span leaf=""><br></span><span leaf="">9. https://x.com/nrehiew_/status/2095115984873062675</span><span leaf=""><br></span>