刚刚,GPT-6 Astra背后的Loop技术全被挖出来了
OpenAI新发布的GPT-6 Astra核心采用recurrent depth(循环深度)架构,其技术根源可追溯至Universal Transformer,并由多篇关键论文系统推进:2025年《Scaling up Test-Time Compute》正式命名并验证该范式;《Training-Free Looped Transformers》证明开源模型可免训练套用循环提升性能;而《LoopCoder-v2》则揭示循环次数存在非单调瓶颈——两次最优,三次反降;《Loop the Loopies!》进一步通过layer-loop粒度突破扩展性限制。这些工作共同构成Astra推理能力跃迁的技术底座。
什么是 Looped Transformer?
普通 Transformer 的一次前向传播中,每层参数只被使用一次;而 Looped Transformer(循环 Transformer)会把同一组参数重复使用多次。 所有这些「循环」的玩法,都归于 recurrent depth 这个范畴:

- 整模型循环(model-loop):把整个模型的输出隐状态重新作为输入喂回去——最经典的范式;
- 层块循环(block-loop):只循环中间某一段连续的层;
- 逐层循环(layer-loop):每一层先各自循环几次再往下走——2607.16051(Loopie)的实验发现这种方式扩展性更好;
- 潜变量条件化:用某种潜在输出作为后续循环的条件。

循环结构是固定的、预先配置好的——每个 token 获得完全相同的计算量。这与「想多久算多久」的自适应计算形成对照。
一切的源头:Universal Transformers

Universal Transformer(UT)是一种「时间上并行、自注意力 + 循环」的序列模型,可以看作 Transformer 的推广:它把 Transformer 的可并行性、全局感受野,与 RNN 的循环归纳偏置(recurrent inductive bias)结合起来——同一组参数在时间步(深度方向)上反复应用。

UT 还引入了 ACT(Adaptive Computation Time)机制,允许每个位置「思考」不同的步数。在当年的 bAbI 问答、LAMBADA 语言建模、WMT14 英德翻译等任务上,UT 都取得了领先或极具竞争力的成绩。
为什么它重要:UT 是第一个系统性地把「同一层参数反复应用」作为核心机制的 Transformer 变体。今天 recurrent depth 的所有工作,思想源头都可以追溯到这里。
定名之作:Scaling up Test-Time Compute with Latent Reasoning

如果说 UT 是思想源头,那么这篇 2025 年 2 月的论文就是直接命名了「recurrent depth」概念、并第一个把它做到现代规模的工作。The Information 报道中 Astra 使用的技术,名字正出自这里。
3.1 核心思想:在潜在空间里「想」,而不是在文字里「说」
主流推理模型(o 系列、R1 系列)靠生成更多 token 来扩展测试时计算——思维链越长,算得越多。这篇论文走了一条完全不同的路:通过迭代一个循环块,在测试时把网络「展开」到任意深度,让模型在潜在空间中隐式推理。
这带来几个独特优势:不需要任何 CoT 专项训练数据;可以在很小的上下文窗口下工作;而且能捕捉难以用语言表达的思维类型。

3.2 怎么训练的?
- 架构即第一节的三段式:Prelude → 共享循环块 R → Coda,带输入注入和残差连接;
- 训练时随机采样循环次数(用 log-normal Poisson 分布),让模型对任意循环深度都鲁棒;
- 规模:3.5B 参数、800B token 的预训练——这在学术资源下是相当大的手笔。
3.3 效果:3.5B 打出 50B 的等效表现
作者最关键的主张是:随着测试时循环次数增加,模型性能持续提升,最高可达到约 50B 参数模型的等效计算水平——而物化参数只有 3.5B。

和同训练配置、同数据的非循环基线对比(下表),差距是碾压性的:同样 0.8T token 训练,循环模型在 r=32 时 ARC-E 拿到 69.91(基线 46.42)、HellaSwag 65.21(基线 37.34)、GSM8K CoT 从几乎为 0 提升到 34.80/42.08。

3.4 最迷人的部分:潜在空间里到底发生了什么?
这篇论文最有「科幻感」的贡献,是对潜在空间动力学的可视化分析。作者发现模型在循环中展现出了可识别的、类似「思考」的几何结构:

免训练玩法:Training-Free Looped Transformers

前面的工作都要从头训练循环结构,这篇论文问了一个非常实用的问题:已经训练好的开源模型,能不能直接在推理时「套个循环外壳」就变强? 答案是:可以,但姿势很重要。

4.1 关键洞察:把 Transformer 块看作 ODE 的一步
朴素地把层块原样循环通常会掉点。突破口来自一个数学视角——pre-norm Transformer 块可以看作某个 ODE 上的前向欧拉步(forward Euler step)。于是「循环」不应是简单重复,而应是把「一个大步」换成「多个阻尼小步」,即对同一个数值近似的精细化(Runge-Kutta 风格)。

4.2 效果:7 个模型家族全面验证
在 7 个模型家族(稠密、稀疏 MoE、MLA+MoE)上做了开箱即用的验证,没有逐格调参:

从结果表看,提升覆盖面相当广:Qwen3-4B-Instruct MMLU-Pro 从 0.5714 → 0.5979(+2.64pp)、GPQA-Main +2.01pp;Llama-3.2 系列、Qwen1.5-MoE、Moonlight-16B-A3B、DeepSeek-V2-Lite 等也普遍有 0.7~2.3 个百分点的提升。

论文还给出了一套实用的「配方」发现:循环窗口 n=4 是甜点,n≥6 会出现性能悬崖。这篇论文的意义在于:循环深度不再是大厂的专利,任何人都可以在今天已有的开源模型上免费蹭到一波提升。
重要的泼冷水:LoopCoder-v2 发现「循环两次就够了」

如果说前面的论文都在说「循环真香」,这篇论文则贡献了本方向最重要的反直觉发现:循环不是越多越好,两次就是最优,三次以上反而回退。 这也是科普推文中「looping more than two times actually led to regressions」的出处。
5.1 工程创新:并行循环 Transformer(PLT)
顺序循环有个致命缺点:延迟和 KV cache 随循环次数线性增长。作者提出的 PLT(Parallel Loop Transformer)通过跨循环位置偏移(CLP)和共享 KV 的门控滑窗注意力,让延迟和 KV 内存都近似常数,从而把「循环几次」变成一个可以自由研究的实验变量。

5.2 主实验:18T token 从头训练 7B 代码模型
作者用相同的配方从头训练了不同循环次数的 7B PLT 代码模型家族(18T token 预训练 + 对齐的指令微调),结果非常戏剧性:

5.3 为什么第三次循环反而有害?
诊断分析给出了清晰的机制解释:

这个「强烈的非单调循环次数效应」是整个领域必须面对的约束。值得玩味的是:如果 Astra 真的用了 recurrent depth,OpenAI 大概率已经找到了绕过这个「两次就饱和」瓶颈的办法——否则无法解释 Astra 展现出的那种断崖式领先。至于是什么办法,恐怕就是 OpenAI 不愿写在发布页里的部分了。
规模化验证:Loop the Loopies!
这是 5 篇论文中最「工程硬核」的一篇,它正面回应了循环架构面临的最大质疑:
给定 N 倍的预训练计算量,直接把参数量扩大 N 倍,通常比把模型循环 N 次更划算。
如果这个质疑成立,循环深度就永远只是学术玩具。Loopie 的任务就是打破这个魔咒。
6.1 Layer-loop:更好的循环粒度
系统对比了不同循环粒度的扩展性,发现逐层循环(layer-loop)比整模型循环(model-loop)扩展性更好——这正是科普推文引用的结论。








JOTO 企业落地观察
- 对企业部署意味着:循环深度技术将显著降低高阶推理能力的硬件门槛。企业无需采购千卡集群即可运行具备“深度思考”能力的模型,但需重构推理服务框架以支持动态循环调度与KV缓存复用。
- 对智能体工程而言:固定循环结构(而非自适应计算)使推理路径可预测、可观测、可审计,有利于构建符合金融、政务等强合规场景要求的确定性AI工作流。
- 对RAG知识工程提出新取舍:当模型可在潜在空间内完成多步隐式推理,传统依赖显式检索-重排-生成链路的RAG范式可能面临冗余风险;企业需评估是否将知识召回环节前置到循环内部,以压缩端到端延迟。
- 对AI安全治理构成新挑战:循环过程不产生中间token,导致传统基于输出内容的安全过滤、水印嵌入、责任溯源手段失效,亟需发展针对隐状态空间的实时监控与干预能力。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


