核心观点
- 2026 年春季开源模型发布的核心主题是「长上下文降本」:推理模型与 Agent 工作流让 token 滞留更久,KV cache 大小、内存流量与注意力成本成为首要约束。
- Gemma 4 引入跨层 KV 共享(E2B/E4B 变体复用前层键值状态)与逐层嵌入,砍掉长上下文的内存与计算。
- DeepSeek V4 把 mHC(多头压缩)与压缩注意力结合,ZAYA1-8B 用卷积压缩注意力,Laguna XS.2 做逐层注意力预算——每条路都指向「在注意力计算上省钱」。
- 这些看似架构图里的小改动,实则是决定长上下文时代模型成本曲线的重要设计变更。
内容精讲
过去几周开源权重模型密集发布,贯穿它们的一条主线非常清楚:长上下文效率。推理模型和 Agent 工作流让模型「保留的 token 更多、更久」,KV cache 的规模、内存带宽和注意力计算成本迅速变成主要瓶颈。各厂商于是叠加了一整套架构技巧来压低这些成本。这篇文章聚焦 transformer 块内部、残差流、KV cache 与注意力计算层面发生了什么变化。
**Gemma 4:跨层 KV 共享 + 逐层嵌入。** Gemma 4 家族分三档:E2B/E4B 面向移动与嵌入式设备、26B MoE 面向本地高效推理、31B dense 追求最高质量。E2B/E4B 的第一个小巧改动是共享 KV cache:后面的层直接复用前面层的键值状态,从而减少长上下文下的内存与计算。这项技术并非 Gemma 4 首创——Brandon 等人的 Cross-Layer Attention(NeurIPS 2024)早有提法,但 Gemma 4 是第一个把它应用到主流开源模型上的。动机很直接:KV cache 规模是当前内存的主要消耗源,削减它就能支持更长的上下文——而在推理模型与 Agent 时代,更长的上下文几乎等于更强的任务能力。
**ZAYA1-8B:卷积压缩注意力。** 用卷积操作压缩注意力输入的某些维度,让注意力计算本身更省。这类「压缩注意力」思路的共同点是把 KV 的表示压缩后再做注意力,牺牲少量精度换取长上下文下显著的内存与带宽收益。
**Laguna XS.2:逐层注意力预算。** 不是所有层都需要同样多的注意力容量。给不同层分配不同的注意力预算(层级配置),让「该省的层省、该富的层富」,整体成本因此下降。这类层间预算分配的思路在最近的开源模型中越来越多见。
**DeepSeek V4:mHC + 压缩注意力。** DeepSeek V4 把多头压缩(multi-head compression,mHC)与压缩注意力结合起来。mHC 是 MLA(多头潜在注意力)思路的进一步延伸——把多个头的 KV 压缩成共享的紧凑表示,再配合注意力层面的压缩,在保持推理质量的同时大幅削减 KV cache 与注意力开销。值得注意的是,DeepSeek 此前凭 MLA 系列已把「KV cache 瘦身」做成了招牌技术,V4 的 mHC 是这条路线上的又一次迭代。
**为什么这些「小改动」值得单独讲。** 在架构图里,KV 共享、卷积压缩、注意力预算看起来都是几笔改动;但实现上它们是相当精妙的设计变更——涉及残差流内的信息复用、注意力计算的局部形状、以及训练时如何让模型适应被压缩的表示。对从业者的启示是:2026 年选模型的判断维度又多了一条——不止看总参数与基准分数,还要看它用哪些机制处理长上下文,因为同样的 128K 上下文窗口,背后的 KV cache 成本可能差出数量级。
阅读价值
对 LLM 架构研究者与推理工程团队,这篇文章把四个最新的「长上下文降本」设计逐一拆开,可与 GQA、MLA、滑动窗口、混合注意力等既有变体对照理解;对做模型选型的工程师,它提供了一个判断新架构「在长上下文上是否真的省钱」的检查清单。
内容与图片版权归原作者所有 · 原文: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures