最近 OpenAI Astra 模型被传成用了 “recurrent depth / looped transformer”(循环深度/循环 Transformer 架构),听起来像是什么能隐藏推理过程的新魔法。但如果你看过 Nanbeige 4.2 的技术报告,会发现这个被热议的架构其实只是一个很小的改动:把 Transformer 的同一组层重复用几次。

Composite diagram comparing claims about OpenAI Astra's recurrent depth with Nan
Composite diagram comparing claims about OpenAI Astra's recurrent depth with Nan

先解释一下背景。Transformer 模型(一种基于注意力机制的深度学习架构)通常由几十层网络堆叠而成,输入文本被切成 token(最小文本单元)后,依次经过每一层计算。标准做法是每层只过一次。Looped transformer 的想法很简单:不增加新的层,而是把已有的层堆栈再跑一遍。Nanbeige 4.2-3B 就是典型例子:它从零开始在 28T tokens 上预训练,核心结构是一个 22 层的 Transformer 块,但这个块被复用了两次。

这意味着什么?从深度上看,模型等效于 44 层,但权重只有 22 层的量。如果忽略 embedding(把 token 映射成向量的层)和输出层,这相当于把模型容量翻倍,却不需要 2 倍的存储和内存。代价是计算量几乎翻倍,因为每个 token 要经过接近两倍的层数。换句话说,这是一个用算力换参数量的交易。

为什么 Nanbeige 选择两次而不是更多?技术报告里提到,两次 pass(pass 指一次完整的前向计算)是最佳折中,能保留标准架构大约 75% 的 token 效率(token efficiency,即每个训练 token 对模型性能的贡献)。如果继续增加 pass 次数,收益非常有限,但训练会明显变慢、变贵。

这个思路其实也不是 Nanbeige 首创。更早的 NeurIPS(机器学习领域的顶级会议)论文 “Mixture-of-recursions: Learning dynamic recursive depths for adaptive token-level computation” 就提出过类似机制,而且更精致:它加了一个可学习的 router(路由器,决定每个 token 需要计算几次),简单的 token 可以提前退出,难的 token 则多算几次。这种动态深度比固定循环两次更聪明,也更接近 “按需计算” 的推理优化。

回到 Astra。Astra 可能确实是个好模型,但 “looped transformer” 这个点被过度放大了。它本质上只是一个很小的架构调整,并不神秘。至于 “这种新技术会隐藏 AI 的推理过程(chain-of-thought,即模型在给出答案前生成的中间推理步骤)” 的说法,也不一定成立。层复用本身不会抑制可见的思维链,它只是在输出下一个 token 之前增加了隐藏状态的计算,这和普通 Transformer 层做的事情没有本质区别。如果模型用了更多循环 pass,确实可能减少需要生成的中间推理 token,让更多计算发生在 latent activations(网络内部无法直接读成文本的激活值)里。但如果你只是把模型规模做大,比如从 GPT 5.6 Luna 换成 GPT 5.6 Sol,也会得到类似效果。

所以这个架构能给我们什么启发?如果你在部署模型时受限于存储或内存,层复用可以作为一种增加深度的手段,但必须接受计算成本上升和 token 效率下降。如果你在做推理优化,动态 router 的思路可能更有价值:让简单请求少算几步,复杂请求多算几步,而不是对所有 token 一视同仁。最后,面对 “新架构” 的 hype(炒作),值得多问一句:它到底改了什么?如果只是把层复用两次,那它可能并不值得被当成革命性突破。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://sebastianraschka.com/blog/2026/openai-astra-looped-transformers.html