刚刚,GPT-6 Astra背后的Loop技术全被挖出来了
一、什么是 Looped Transformer?
普通 Transformer 的一次前向传播中,每层参数只被使用一次;而 Looped Transformer(循环 Transformer)会把同一组参数重复使用多次。 所有这些「循环」的玩法,都归于 recurrent depth 这个范畴:
-
整模型循环(model-loop):把整个模型的输出隐状态重新作为输入喂回去——最经典的范式;
-
层块循环(block-loop):只循环中间某一段连续的层;
-
逐层循环(layer-loop):每一层先各自循环几次再往下走——2607.16051(Loopie)的实验发现这种方式扩展性更好;
-
潜变量条件化:用某种潜在输出作为后续循环的条件。
Recurrent Depth 架构示意
最关键的一点:循环结构是固定的、预先配置好的——每个 token 获得完全相同的计算量。这与「想多久算多久」的自适应计算形成对照。
二、一切的源头:Universal Transformers
Universal Transformer(UT)是一种「时间上并行、自注意力 + 循环」的序列模型,可以看作 Transformer 的推广:它把 Transformer 的可并行性、全局感受野,与 RNN 的**循环归纳偏置(recurrent inductive bias)**结合起来——同一组参数在时间步(深度方向)上反复应用。
Universal Transformer 结构图
UT 还引入了 ACT(Adaptive Computation Time)机制,允许每个位置「思考」不同的步数。在当年的 bAbI 问答、LAMBADA 语言建模、WMT14 英德翻译等任务上,UT 都取得了领先或极具竞争力的成绩。
为什么它重要:UT 是第一个系统性地把「同一层参数反复应用」作为核心机制的 Transformer 变体。今天 recurrent depth 的所有工作,思想源头都可以追溯到这里。
三、定名之作:Scaling up Test-Time Compute with Latent Reasoning
如果说 UT 是思想源头,那么这篇 2025 年 2 月的论文就是直接命名了「recurrent depth」概念、并第一个把它做到现代规模的工作。The Information 报道中 Astra 使用的技术,名字正出自这里。
3.1 核心思想:在潜在空间里「想」,而不是在文字里「说」
主流推理模型(o 系列、R1 系列)靠生成更多 token 来扩展测试时计算——思维链越长,算得越多。这篇论文走了一条完全不同的路:通过迭代一个循环块,在测试时把网络「展开」到任意深度,让模型在潜在空间中隐式推理。
这带来几个独特优势:不需要任何 CoT 专项训练数据;可以在很小的上下文窗口下工作;而且能捕捉难以用语言表达的思维类型。
不同循环深度下的性能
3.2 怎么训练的?
-
架构即第一节的三段式:Prelude → 共享循环块 R → Coda,带输入注入和残差连接;
-
训练时随机采样循环次数(用 log-normal Poisson 分布),让模型对任意循环深度都鲁棒;
-
规模:3.5B 参数、800B token 的预训练——这在学术资源下是相当大的手笔。
3.3 效果:3.5B 打出 50B 的等效表现
作者最关键的主张是:随着测试时循环次数增加,模型性能持续提升,最高可达到约 50B 参数模型的等效计算水平——而物化参数只有 3.5B。
性能随测试时循环次数增长
和同训练配置、同数据的非循环基线对比(下表),差距是碾压性的:同样 0.8T token 训练,循环模型在 r=32 时 ARC-E 拿到 69.91(基线 46.42)、HellaSwag 65.21(基线 37.34)、GSM8K CoT 从几乎为 0 提升到 34.80/42.08。
循环 vs 非循环基线对比
3.4 最迷人的部分:潜在空间里到底发生了什么?
这篇论文最有「科幻感」的贡献,是对潜在空间动力学的可视化分析。作者发现模型在循环中展现出了可识别的、类似「思考」的几何结构:
数学问题中的潜在空间轨迹
四、免训练玩法:Training-Free Looped Transformers
前面的工作都要从头训练循环结构,这篇论文问了一个非常实用的问题:已经训练好的开源模型,能不能直接在推理时「套个循环外壳」就变强? 答案是:可以,但姿势很重要。
免训练循环包装器
4.1 关键洞察:把 Transformer 块看作 ODE 的一步
朴素地把层块原样循环通常会掉点。突破口来自一个数学视角——pre-norm Transformer 块可以看作某个 ODE 上的前向欧拉步(forward Euler step)。于是「循环」不应是简单重复,而应是把「一个大步」换成「多个阻尼小步」,即对同一个数值近似的精细化(Runge-Kutta 风格)。
RK 积分 vs 朴素循环
4.2 效果:7 个模型家族全面验证
在 7 个模型家族(稠密、稀疏 MoE、MLA+MoE)上做了开箱即用的验证,没有逐格调参:
各基准上的提升
从结果表看,提升覆盖面相当广:Qwen3-4B-Instruct MMLU-Pro 从 0.5714 → 0.5979(+2.64pp)、GPQA-Main +2.01pp;Llama-3.2 系列、Qwen1.5-MoE、Moonlight-16B-A3B、DeepSeek-V2-Lite 等也普遍有 0.7~2.3 个百分点的提升。
主要结果表
论文还给出了一套实用的「配方」发现:循环窗口 n=4 是甜点,n≥6 会出现性能悬崖。这篇论文的意义在于:循环深度不再是大厂的专利,任何人都可以在今天已有的开源模型上免费蹭到一波提升。
五、重要的泼冷水:LoopCoder-v2 发现「循环两次就够了」
如果说前面的论文都在说「循环真香」,这篇论文则贡献了本方向最重要的反直觉发现:循环不是越多越好,两次就是最优,三次以上反而回退。 这也是科普推文中「looping more than two times actually led to regressions」的出处。
5.1 工程创新:并行循环 Transformer(PLT)
顺序循环有个致命缺点:延迟和 KV cache 随循环次数线性增长。作者提出的 PLT(Parallel Loop Transformer)通过跨循环位置偏移(CLP)和共享 KV 的门控滑窗注意力,让延迟和 KV 内存都近似常数,从而把「循环几次」变成一个可以自由研究的实验变量。
并行循环 Transformer(arXiv:2606.18023, Figure 1)
5.2 主实验:18T token 从头训练 7B 代码模型
作者用相同的配方从头训练了不同循环次数的 7B PLT 代码模型家族(18T token 预训练 + 对齐的指令微调),结果非常戏剧性:
主要结果(arXiv:2606.18023, Table 2)
5.3 为什么第三次循环反而有害?
诊断分析给出了清晰的机制解释:
各循环的贡献分解(arXiv:2606.18023, Figure 7)
这个「强烈的非单调循环次数效应」是整个领域必须面对的约束。值得玩味的是:如果 Astra 真的用了 recurrent depth,OpenAI 大概率已经找到了绕过这个「两次就饱和」瓶颈的办法——否则无法解释 Astra 展现出的那种断崖式领先。至于是什么办法,恐怕就是 OpenAI 不愿写在发布页里的部分了。
六、规模化验证:Loop the Loopies!
这是 5 篇论文中最「工程硬核」的一篇,它正面回应了循环架构面临的最大质疑:
给定 N 倍的预训练计算量,直接把参数量扩大 N 倍,通常比把模型循环 N 次更划算。
如果这个质疑成立,循环深度就永远只是学术玩具。Loopie 的任务就是打破这个魔咒。
6.1 Layer-loop:更好的循环粒度
系统对比了不同循环粒度的扩展性,发现逐层循环(layer-loop)比整模型循环(model-loop)扩展性更好——这正是科普推文引用的结论。
Layer-loop vs Model-loop 扩展性
6.2 Loopie 系列:20B-A2B 与 6B-A0.6B
Loopie 发布了两个 MoE 模型:20B 总参/2B 激活 和 6B 总参/0.6B 激活。大量消融实验(包括与一个 vanilla 30B-A3B 模型的对照)表明:在相同计算预算下,Loopie 显著超越普通 Transformer 基线。
Loopie 主结果
配合作者提出的新型后训练方法(SPT,Supervised Pre-training),Loopie 发展出了强推理能力。与同量级 MoE 推理模型的对比相当有说服力:
与同级 MoE 推理模型对比
这篇论文的信号非常明确:循环深度已经跨过了「学术玩具 → 可规模化训练范式」的临界点。 时间点也很微妙——论文 7 月挂出,Astra 9 月发布。
<span leaf="">1. Universal Transformers https://arxiv.org/abs/1807.03819</span><span leaf=""><br></span><span leaf="">2. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach https://arxiv.org/abs/2502.05171</span><span leaf=""><br></span><span leaf="">3. Training-Free Looped Transformers https://arxiv.org/abs/2605.23872</span><span leaf=""><br></span><span leaf="">4. LoopCoder-v2: Only Loop Once </span><span><span leaf="">for</span></span><span leaf=""> Efficient Test-Time Computation Scaling https://arxiv.org/abs/2606.18023 </span><span leaf=""><br></span><span leaf="">5.Loop the Loopies! https://arxiv.org/abs/2607.16051</span><span leaf=""><br></span><span leaf="">6. OpenAI. _GPT-6 Astra https://openai.com/index/gpt-6-astra/=</span><span leaf=""><br></span><span leaf="">7. Stephanie Palazzolo (The Information). _Secret Technique Behind OpenAI’s Astra Model Sparks Security Concerns_. 2026-09-02.</span><span leaf=""><br></span><span leaf="">8.https://x.com/kimmonismus/status/2095045887131087357</span><span leaf=""><br></span><span leaf="">9. https://x.com/nrehiew_/status/2095115984873062675</span><span leaf=""><br></span>
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai/post/20260906/%E5%88%9A%E5%88%9AGPT-6-Astra%E8%83%8C%E5%90%8E%E7%9A%84Loop%E6%8A%80%E6%9C%AF%E5%85%A8%E8%A2%AB%E6%8C%96%E5%87%BA%E6%9D%A5%E4%BA%86/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com