中文精炼导读

核心观点

  • Sebastian Raschka 综述了 2026 年 4-5 月开源权重 LLM 在架构上的最新进展,核心主题是"长上下文效率":随着推理模型与 agent 工作流保留越来越多 token,KV cache 大小、内存流量与注意力成本成为主要约束,各厂商纷纷给 Transformer 加各种架构技巧来降本。
  • 四个重点案例:Gemma 4 的跨层 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力、DeepSeek V4 的 mHC(约束混合通道)+ 压缩注意力(CSA/HCA)。
  • Gemma 4 E2B/E4B 的 KV 共享(cross-layer attention,非 cross-attention):后层不再计算自己的 K/V 投影,而是复用最近的"同注意力类型"的非共享层的 KV 张量(滑动窗口层共享滑动窗口、全注意力层共享全注意力),每层仍算自己的 Q 以保持各自的注意力模式——约共享一半 KV,E2B 在 128K 上下文下省约 2.7GB(E4B 约 6GB);代价是"近似"、减少模型容量,但论文显示对小模型影响很小。
  • DeepSeek V4 的 CSA/HCA 与 MLA 式压缩不同:MLA 压缩每个 token 的 KV 表示但仍为每个 token 保留一个潜变量条目,而 CSA/HCA 沿序列维度压缩——把一组 token 汇总成更少的压缩 KV 条目,让缓存变短;CSA 用较轻压缩 + DSA 式稀疏 top-k 选择,HCA 每 128 个 token 压成一个条目、对短缓存做稠密注意力,两者交替并都保留 128-token 滑动窗口分支。
  • 实测数据:1M 上下文下 DeepSeek V4-Pro 只用 DeepSeek V3.2 的 27% 单 token 推理 FLOPs 与 10% 的 KV cache 大小(V4-Flash 更是 10% FLOPs / 7% KV);但作者强调这些结果是完整配方(更好数据、Muon 优化、mHC、精度/存储优化等)的产物,CSA/HCA 是效率导向设计而非"普遍比 MLA 好"。
MLA、CSA 与 HCA 的概念对比
MLA、CSA 与 HCA 的概念对比

内容精讲

文章开篇点明观察:休假回来后,最令他印象深刻的是"新架构多么聚焦长上下文效率"。推理模型与 agent 工作流让更多 token 被保留更久,KV cache 大小、内存流量与注意力成本很快成为主要约束,LLM 开发者正加入越来越多的架构技巧来削减这些成本。本文聚焦四个案例:Gemma 4 的 KV 共享与逐层嵌入、Laguna XS.2 的逐层注意力预算、ZAYA1-8B 的压缩卷积注意力、DeepSeek V4 的 mHC 与压缩注意力。作者声明范围刻意收窄——只讨论 Transformer 块内部、残差流、KV cache 或注意力计算的变化,跳过数据集混合、训练计划、后训练细节、RL 配方与基准表,且只覆盖"有趣(新颖)且他还没在其他地方讲过"的设计。

第一部分讲 Gemma 4 的跨层 KV 共享。Gemma 4 分三类:面向移动与小型本地/嵌入式设备的 E2B 与 E4B、面向高效本地推理的 26B MoE、以及追求最高质量、后训练更方便的 31B 稠密模型。E2B/E4B 的第一个小技巧是采用共享 KV cache 方案:后层复用前层的键值状态以减少长上下文内存与计算。这种 KV 共享并非 Gemma 4 发明(见 Brandon 等人 NeurIPS 2024 的 cross-layer attention 论文),但 Gemma 4 是他见过的第一个应用该概念的流行架构。KV 共享的动机是 KV cache 大小削减——进而降低所需内存、支持更长上下文,这在推理模型与 agent 时代尤其相关。区别于 GQA(Gemma 4 仍用)在 query 头之间共享 KV 头,跨层 KV 共享是把 K/V 投影跨层复用:后层不再计算自己的 K/V 投影,而是复用最近的"同一注意力类型"的非共享层的 KV 张量——滑动窗口层共享滑动窗口层、全注意力层共享全注意力层;每层仍计算自己的 Q 投影,所以能形成各自的注意力模式,但昂贵且占内存的 KV cache 被多层复用。具体数字:Gemma 4 E2B 有 35 层,只有前 15 层计算自己的 KV,后 20 层复用;E4B 有 42 层、24 层自算 KV、后 18 层共享。由于大约共享一半 KV,KV cache 约省一半——E2B 在 bfloat16、128K 长上下文下省约 2.7GB(E4B 约 6GB),滑动窗口带来的额外节省未计入。代价是这算一种"近似"、减少了模型容量,但 cross-layer attention 论文显示对小模型影响可以很小。

Gemma 4 的 KV cache 内存节省
Gemma 4 的 KV cache 内存节省

第二部分是 Gemma 4 E2B/E4B 的逐层嵌入(per-layer embeddings,PLE)与"有效"参数。PLE 与 KV 共享无关,它针对参数效率:让小型 Gemma 4 模型在不把主 Transformer 栈做成同参数量稠密模型那么昂贵的前提下,使用更多 token 特定信息。"E"代表"effective":Gemma 4 E2B 标称 23 亿有效参数、计入嵌入则是 51 亿参数(E4B 为 45 亿有效 / 80 亿含嵌入)。也就是说"E"模型的主栈计算更接近小数,大数包含额外的嵌入表层。文章随后还讲解了 ZAYA1-8B 的压缩卷积注意力(把注意力移到压缩的潜空间)与 Laguna XS.2 的逐层注意力预算(调整每层分到的注意力容量)——这些都是"在 Transformer 块里做定点改动"的例子。

最后是 DeepSeek V4 的两大架构变化。其一是 mHC(约束混合通道):把单一残差流替换成几个相互作用的残差流,mHC 加上额外的稳定性约束,计算开销极小,且与注意力侧的 CSA/HCA 变化配合良好。其二是注意力侧的 CSA/HCA(Compressed Sparse Attention 与 Heavily Compressed Attention)。关键区分:CSA/HCA 是"另一种压缩"——MLA 主要压缩每个 token 的 KV 表示(每个 token 仍保留一个潜变量条目),而 CSA/HCA 沿序列维度压缩,把一组 token 汇总成更少的压缩 KV 条目,于是缓存变短。CSA 用较轻的压缩(m=4)+ DSA 式稀疏 top-k 选择,保留更多细节但做稀疏选择;HCA 压缩更狠(每 128 个 token 压缩成一个条目)但对这些重度压缩的条目做稠密注意力。两条路径都包含一个 128-token 滑动窗口分支保留最近未压缩的 KV 条目——这让两者互补,所以 DeepSeek V4 交替使用 CSA 与 HCA 层而非只用其一。代价也不同于 MLA:CSA/HCA 减少了序列条目本身、放弃一些 token 级信息来换取低得多的长上下文成本,压缩过强会伤建模质量,因此不依赖单一压缩方案。论文报告:1M 上下文下 V4-Pro 只用 V3.2(MLA + DSA)27% 的单 token 推理 FLOPs 与 10% 的 KV cache;V4-Flash 更是 10% FLOPs / 7% KV。作者提醒这些数字是完整 DeepSeek V4 配方(更好数据、Muon 优化、mHC、精度/存储优化、训练/推理系统变更)的产物,且论文没有消融研究;他个人倾向把 CSA/HCA 视为"效率导向的长上下文设计,在旗舰大模型上似乎很好地保持了建模质量,但不一定普遍优于 MLA"。

结论部分给出了 2026 年的总体判断:大多数新开源模型都在"不通过缩小总参数量"来让长上下文推理更便宜——Gemma 4 用跨层 KV 共享削减 KV cache 内存、用逐层嵌入增加容量;Laguna XS.2 调整每层注意力容量;ZAYA1-8B 把注意力移进压缩潜空间;DeepSeek V4 加约束残差流混合与压缩长上下文注意力。这些改动都增加了复杂度——这正是 LLM 架构目前的发展方向。作者的核心启示是:Transformer 块仍在变化,但方式是相当有针对性的——基本配方仍是原始 GPT 解码器式 Transformer,但许多部分被升级或替换、变得更适配长上下文与高效推理,而定性建模性能似乎主要由数据质量(与数量)和训练配方驱动。关于"Transformer 何时被替代":扩散模型等设计存在,但 Transformer 仍是 SOTA 发布的主流;不过每季度都有更多改动——基础 Transformer 块 50-100 行 PyTorch 就能实现,这些改动(尤其注意力变体)把代码复杂度放大了约 10 倍。这不是坏事(这些改动降低而非提高运行时成本),但越来越难对单个组件及其交互形成清晰理解——初看 DeepSeek V4 源码的人会被淹没。作者的应对之道是"一次学一个架构":从原始解码器式 LLM(GPT/GPT-2)出发、逐个添加并学习新组件,让学习负担可控。

阅读价值

适合 LLM 架构研究者、推理优化工程师与想跟上开源模型架构演进的读者:这篇文章把 2026 年长上下文效率的四大新技巧(跨层 KV 共享、逐层嵌入、注意力预算、CSA/HCA 序列压缩)讲得具体且可量化,并正确地把"架构技巧"与"整体配方"分开看待;"Transformer 块仍在定点式演进、复杂度放大 10 倍"的判断与"一次学一个架构"的学习建议,对入门者与从业者都很有价值。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures