JOTO
Contact us
← AI 智库
大语言模型

刚刚,GPT-6 Astra背后的Loop技术全被挖出来了

2026 年 9 月 5 日

OpenAI新发布的GPT-6 Astra核心采用recurrent depth(循环深度)架构,其技术根源可追溯至Universal Transformer,并由多篇关键论文系统推进:2025年《Scaling up Test-Time Compute》正式命名并验证该范式;《Training-Free Looped Transformers》证明开源模型可免训练套用循环提升性能;而《LoopCoder-v2》则揭示循环次数存在非单调瓶颈——两次最优,三次反降;《Loop the Loopies!》进一步通过layer-loop粒度突破扩展性限制。这些工作共同构成Astra推理能力跃迁的技术底座。

什么是 Looped Transformer?

普通 Transformer 的一次前向传播中,每层参数只被使用一次;而 Looped Transformer(循环 Transformer)会把同一组参数重复使用多次。 所有这些「循环」的玩法,都归于 recurrent depth 这个范畴:

Looped Transformer 架构示意
Looped Transformer 架构示意
  1. 整模型循环(model-loop):把整个模型的输出隐状态重新作为输入喂回去——最经典的范式;
  2. 层块循环(block-loop):只循环中间某一段连续的层;
  3. 逐层循环(layer-loop):每一层先各自循环几次再往下走——2607.16051(Loopie)的实验发现这种方式扩展性更好;
  4. 潜变量条件化:用某种潜在输出作为后续循环的条件。
Recurrent Depth 架构示意
Recurrent Depth 架构示意

循环结构是固定的、预先配置好的——每个 token 获得完全相同的计算量。这与「想多久算多久」的自适应计算形成对照。

一切的源头:Universal Transformers

Universal Transformer 时间线
Universal Transformer 时间线

Universal Transformer(UT)是一种「时间上并行、自注意力 + 循环」的序列模型,可以看作 Transformer 的推广:它把 Transformer 的可并行性、全局感受野,与 RNN 的循环归纳偏置(recurrent inductive bias)结合起来——同一组参数在时间步(深度方向)上反复应用。

Universal Transformer 结构图
Universal Transformer 结构图

UT 还引入了 ACT(Adaptive Computation Time)机制,允许每个位置「思考」不同的步数。在当年的 bAbI 问答、LAMBADA 语言建模、WMT14 英德翻译等任务上,UT 都取得了领先或极具竞争力的成绩。

为什么它重要:UT 是第一个系统性地把「同一层参数反复应用」作为核心机制的 Transformer 变体。今天 recurrent depth 的所有工作,思想源头都可以追溯到这里。

定名之作:Scaling up Test-Time Compute with Latent Reasoning

Scaling up Test-Time Compute 论文封面
Scaling up Test-Time Compute 论文封面

如果说 UT 是思想源头,那么这篇 2025 年 2 月的论文就是直接命名了「recurrent depth」概念、并第一个把它做到现代规模的工作。The Information 报道中 Astra 使用的技术,名字正出自这里。

3.1 核心思想:在潜在空间里「想」,而不是在文字里「说」

主流推理模型(o 系列、R1 系列)靠生成更多 token 来扩展测试时计算——思维链越长,算得越多。这篇论文走了一条完全不同的路:通过迭代一个循环块,在测试时把网络「展开」到任意深度,让模型在潜在空间中隐式推理。

这带来几个独特优势:不需要任何 CoT 专项训练数据;可以在很小的上下文窗口下工作;而且能捕捉难以用语言表达的思维类型

不同循环深度下的性能
不同循环深度下的性能

3.2 怎么训练的?

  • 架构即第一节的三段式:Prelude → 共享循环块 R → Coda,带输入注入和残差连接;
  • 训练时随机采样循环次数(用 log-normal Poisson 分布),让模型对任意循环深度都鲁棒;
  • 规模:3.5B 参数、800B token 的预训练——这在学术资源下是相当大的手笔。

3.3 效果:3.5B 打出 50B 的等效表现

作者最关键的主张是:随着测试时循环次数增加,模型性能持续提升,最高可达到约 50B 参数模型的等效计算水平——而物化参数只有 3.5B。

性能随测试时循环次数增长
性能随测试时循环次数增长

和同训练配置、同数据的非循环基线对比(下表),差距是碾压性的:同样 0.8T token 训练,循环模型在 r=32 时 ARC-E 拿到 69.91(基线 46.42)、HellaSwag 65.21(基线 37.34)、GSM8K CoT 从几乎为 0 提升到 34.80/42.08。

循环 vs 非循环基线对比
循环 vs 非循环基线对比

3.4 最迷人的部分:潜在空间里到底发生了什么?

这篇论文最有「科幻感」的贡献,是对潜在空间动力学的可视化分析。作者发现模型在循环中展现出了可识别的、类似「思考」的几何结构

数学问题中的潜在空间轨迹
数学问题中的潜在空间轨迹

免训练玩法:Training-Free Looped Transformers

Training-Free Looped Transformers 论文封面
Training-Free Looped Transformers 论文封面

前面的工作都要从头训练循环结构,这篇论文问了一个非常实用的问题:已经训练好的开源模型,能不能直接在推理时「套个循环外壳」就变强? 答案是:可以,但姿势很重要。

免训练循环包装器
免训练循环包装器

4.1 关键洞察:把 Transformer 块看作 ODE 的一步

朴素地把层块原样循环通常会掉点。突破口来自一个数学视角——pre-norm Transformer 块可以看作某个 ODE 上的前向欧拉步(forward Euler step)。于是「循环」不应是简单重复,而应是把「一个大步」换成「多个阻尼小步」,即对同一个数值近似的精细化(Runge-Kutta 风格)。

RK 积分 vs 朴素循环
RK 积分 vs 朴素循环

4.2 效果:7 个模型家族全面验证

7 个模型家族(稠密、稀疏 MoE、MLA+MoE)上做了开箱即用的验证,没有逐格调参

各基准上的提升
各基准上的提升

从结果表看,提升覆盖面相当广:Qwen3-4B-Instruct MMLU-Pro 从 0.5714 → 0.5979(+2.64pp)、GPQA-Main +2.01pp;Llama-3.2 系列、Qwen1.5-MoE、Moonlight-16B-A3B、DeepSeek-V2-Lite 等也普遍有 0.7~2.3 个百分点的提升。

主要结果表
主要结果表

论文还给出了一套实用的「配方」发现:循环窗口 n=4 是甜点,n≥6 会出现性能悬崖。这篇论文的意义在于:循环深度不再是大厂的专利,任何人都可以在今天已有的开源模型上免费蹭到一波提升。

重要的泼冷水:LoopCoder-v2 发现「循环两次就够了」

LoopCoder-v2 论文封面
LoopCoder-v2 论文封面

如果说前面的论文都在说「循环真香」,这篇论文则贡献了本方向最重要的反直觉发现循环不是越多越好,两次就是最优,三次以上反而回退。 这也是科普推文中「looping more than two times actually led to regressions」的出处。

5.1 工程创新:并行循环 Transformer(PLT)

顺序循环有个致命缺点:延迟和 KV cache 随循环次数线性增长。作者提出的 PLT(Parallel Loop Transformer)通过跨循环位置偏移(CLP)共享 KV 的门控滑窗注意力,让延迟和 KV 内存都近似常数,从而把「循环几次」变成一个可以自由研究的实验变量。

并行循环 Transformer(arXiv:2606.18023, Figure 1)
并行循环 Transformer(arXiv:2606.18023, Figure 1)

5.2 主实验:18T token 从头训练 7B 代码模型

作者用相同的配方从头训练了不同循环次数的 7B PLT 代码模型家族(18T token 预训练 + 对齐的指令微调),结果非常戏剧性:

刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 17

5.3 为什么第三次循环反而有害?

诊断分析给出了清晰的机制解释:

刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 18

这个「强烈的非单调循环次数效应」是整个领域必须面对的约束。值得玩味的是:如果 Astra 真的用了 recurrent depth,OpenAI 大概率已经找到了绕过这个「两次就饱和」瓶颈的办法——否则无法解释 Astra 展现出的那种断崖式领先。至于是什么办法,恐怕就是 OpenAI 不愿写在发布页里的部分了。

规模化验证:Loop the Loopies!

这是 5 篇论文中最「工程硬核」的一篇,它正面回应了循环架构面临的最大质疑:

给定 N 倍的预训练计算量,直接把参数量扩大 N 倍,通常比把模型循环 N 次更划算。

如果这个质疑成立,循环深度就永远只是学术玩具。Loopie 的任务就是打破这个魔咒

6.1 Layer-loop:更好的循环粒度

系统对比了不同循环粒度的扩展性,发现逐层循环(layer-loop)比整模型循环(model-loop)扩展性更好——这正是科普推文引用的结论。

刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 19
刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 20
刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 21
刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 22
刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 23
刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 24
刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 25
刚刚,GPT-6 Astra背后的Loop技术全被挖出来了 配图 26

JOTO 企业落地观察

  • 对企业部署意味着:循环深度技术将显著降低高阶推理能力的硬件门槛。企业无需采购千卡集群即可运行具备“深度思考”能力的模型,但需重构推理服务框架以支持动态循环调度与KV缓存复用。
  • 对智能体工程而言:固定循环结构(而非自适应计算)使推理路径可预测、可观测、可审计,有利于构建符合金融、政务等强合规场景要求的确定性AI工作流。
  • 对RAG知识工程提出新取舍:当模型可在潜在空间内完成多步隐式推理,传统依赖显式检索-重排-生成链路的RAG范式可能面临冗余风险;企业需评估是否将知识召回环节前置到循环内部,以压缩端到端延迟。
  • 对AI安全治理构成新挑战:循环过程不产生中间token,导致传统基于输出内容的安全过滤、水印嵌入、责任溯源手段失效,亟需发展针对隐状态空间的实时监控与干预能力。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.