中文精炼导读

核心观点

  • Sebastian Raschka 延续其长期习惯,发布了 2026 年 1 月至 5 月自己收藏的 LLM 论文清单——这是"基于个人兴趣与相关工作"的精选参考列表,而非全年论文的完整收录(每天发表的论文太多,完整收录根本不可行)。
  • 清单的用途很朴素:写文章、书稿、代码示例或讲课时想起"某篇相关论文在哪看过",分类的 Markdown 清单能让他快速找回——作者强调即使在 LLM 搜索时代,一份有针对性的上下文清单依然很有用。
  • 相比 2025 年的清单,今年的收藏仍然偏重推理模型、强化学习与高效推理(作者当前工作的相关方向),但更多收录了 agent harness、工具使用、长上下文、扩散语言模型与实际 serving 基础设施——"因为这才是领域正在走向的地方"。
  • 按十个类别组织:架构与模型设计、高效训练与扩展、推理效率与 KV cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评估与基准。
  • 他点名的"必读"是 Nemotron 3 Super:论文极其详细、描述的是已投入生产的模型技术,且是同类尺寸中最好的模型之一;其亮点是混合架构(规则注意力层与 Mamba-2 状态空间层交替),2026 年"长上下文效率为王",因为越来越多 LLM 被接进 agent harness(如 OpenClaw)需要处理越来越长的上下文。
Nemotron-3 Super 混合架构(Mamba-2 层)
Nemotron-3 Super 混合架构(Mamba-2 层)

内容精讲

作者在开篇交代了这份清单的由来与定位:他多年保持着一个"想读、想重读、想在以后文章与项目里引用"的论文收藏习惯。去年他分享了两份整理好的论文清单(1-6 月与 7-12 月),读者反馈很有用,于是为 2026 年上半年准备了一份新清单,覆盖 1 月至 5 月收藏的论文。他反复强调这不是当年的完整出版物清单——每天都有海量论文发表,完整收录不现实——而是基于"我觉得有趣或与我自己工作相关"的策展式参考。他整理清单时仔细过了一遍标题、摘要与主题框架,但也坦承只精读了一部分论文。制作这些清单的根本动机很实际:写文章、书稿、代码示例或讲座时,经常想起"某处见过一篇相关论文",但再次找到它却出奇地烦人;分类的 Markdown 清单恰好解决这个问题。

关于今年的主题偏好,作者明确指出:清单依旧"偏重推理模型、强化学习与高效推理",因为他的收藏天然偏向当前正在做的事情;但与 2025 年清单相比,今年收藏了更多关于 agent harness、工具使用、长上下文、扩散语言模型与实际 serving 基础设施的论文——这正是他目前深度参与、也是领域正在演进的方向。清单按十个类别组织(架构与模型设计、高效训练与扩展、推理效率与 KV cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评估与基准),并在 Web 版提供目录方便跳转。

第一个类别"架构与模型设计"得到了最多着墨。作者指出 2026 年架构工作的一个显著变化:不再是单纯把 Transformer 做大,而是涌现出大量围绕混合架构(Nemotron 3、Arcee Trinity)、状态空间层(Nemotron 3 与 Mamba-3)、MoE 容量分配(Scaling Embeddings Outperforms Scaling Experts、Step 3.5 Flash)、激活行为(The Spike, the Sparse and the Sink)与表示几何(Symmetry in Language Statistics Shapes the Geometry of Model Representations)的工作。若只能挑一篇必读,他选 Nemotron 3 Super:论文极详细、描述的是已投入生产的模型技术、且是同类尺寸中最好的模型之一。Nemotron 3 的亮点是混合架构——在规则注意力层与 Mamba-2 状态空间层之间交替,以提升长上下文效率;在 2026 年"长上下文效率为王"的背景下这很关键,因为越来越多 LLM 被接进 agent harness(如 OpenClaw)需要处理越来越长的上下文。不过 120B-A12B 对消费级硬件本地推理可能太大,但也有 Nemotron 3 Nano(4B)版本。文章配图展示了 Nemotron-3 Super 的混合架构;作者还提到两天前 NVIDIA 发布了放大版 Nemotron 3 Ultra(550B-A55B),缩放嵌入与投影维度、其余构建块相同。这个"注意力层与替代层交替"的混合架构趋势今年相当流行:最流行的开源权重 LLM 系列之一 Qwen3.6 就用 Gated DeltaNet 层(而非 Mamba-2)做非注意力部分,作者在自己的 Hybrid Attention 页面上汇总了相关信息。他还预告 Mamba-3 与 Gated DeltaNet-2(即 Mamba-2 与 GatedDeltaNet 的新版本)值得期待,可能出现在接下来的 Nemotron-4 与 Qwen4 中。除混合架构外,Nemotron-3 论文还包含大量有趣的消融实验(多 token 预测用于投机解码、NVFP4 预训练对比 BF16、合成 MMLU 式数据、后训练量化配方),但作者表示详细展开超出本文范围。

这一类别下列出了约 25 篇论文及其日期与 arXiv 链接,从 1 月的 Deep Delta Learning、MiMo-V2-Flash、Ministral 3,到 2 月的 ERNIE 5.0、Step 3.5 Flash(11B 活跃参数)、GLM-5(副题"From Vibe Coding to Agentic Engineering")、Arcee Trinity,再到 3 月的 Mamba-3、4 月的 Nemotron 3 Super、5 月的 Gated DeltaNet-2 与 MiniMax-M2 系列等。其余类别(高效训练、推理效率、稀疏注意力、推理与测试时计算、RLVR、智能体、编码智能体、扩散 LM、评估基准)对订阅者开放,文中只展示了开头——这与作者"给付费订阅者更完整内容"的创作模式一致,但架构类别的完整清单与点评已足以让读者掌握 2026 上半年的主要趋势。

阅读价值

适合希望快速掌握 2026 上半年 LLM 研究方向版图的研究者与工程师:这份清单(尤其架构与模型设计类别)既给出了带链接的论文列表,也点出了"混合架构 + 长上下文效率 + 状态空间层"这一年度主线,还有作者对必读论文(Nemotron 3 Super)的明确推荐;对追踪"领域正在走向哪里"或寻找阅读入口的人是一份高效的路标。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1