核心观点

内容精讲

Scaling Law 的形式很简单:训练损失 L 随模型规模 N、数据集规模 D、算力 C 的扩展而按幂律可预测地下降,在 log-log 坐标下表现为一条直线。本质上它是一个框架,描述算力、损失、模型规模与数据之间的关系——核心问题是:如何把宝贵的算力最优地分配在 N 与 D 之间。这个可预测性让它在实践中极具价值:常见工作流是在少量小规模运行上拟合幂律,然后外推到更大模型来估计 token 与算力需求。

**早在 Scaling Law 成为主流概念之前,损失可预测性就被研究过。** Amari 等人(1992)用贝叶斯方法与退火近似推导出四种学习曲线:确定性算法 + 无噪声数据 + 唯一解 → ε ~ D⁻¹;确定性算法 + 无噪声 + 多等价解 → ε ~ D⁻²(学习更快,因为只需学习最优参数流形而非单个解点);确定性算法 + 有噪声 → ε ~ D⁻¹ᐟ²;随机算法 + 有噪声 → ε ~ D⁻¹ + E,其中 E 是不可约误差(例如数据规模大到超出模型容量时)。四种曲线统一为 ε ~ c·D^α + E 的幂律形式——理论框架虽基于简化的二分类任务,却给经验 ML 损失预测模型指了方向。

**Hestness 等人(2017)做了最早的经验验证。** 在神经机器翻译、图像分类、语言建模、语音识别四个领域,观察到一个反复出现的模式:泛化误差随多个因素(如数据规模)呈幂律缩放;模型改进平移误差曲线但不影响幂律指数;架构改变幂律拟合的偏移(E)而非指数(α);幂律斜率更像是问题域的性质而非模型架构的性质;拟合数据集 D 所需的参数 N 也按幂律缩放。学习曲线被概念性地分成三段:小数据区模型仅略优于随机猜测;中间的幂律区是 loss 与数据、规模呈幂律关系的核心区域;末尾的不可约误差区归因于数据噪声等因素。

**Rosenfeld 等人(2020)推向联合形式。** 把误差建模为 N 与 D 的联合函数,横跨 ResNet、WRN、LSTM、Transformer 等架构和 Adam、SGD 等优化器:固定一个轴时,误差对另一个轴呈幂律衰减;联合起来是 L̂(D,N) ≈ A/N^α + B/D^β + E。这样可以在小于某阈值的小配置集上训练参数化误差模型,外推预测更大 (D,N) 配置的期望 loss。

**数据有限区的幂律更棘手。** 数据无限区(Chinchilla 与 Kaplan 的战场)相对成熟,但真实训练几乎总在数据有限区。数据有限时,模型与数据的交互方式不同,幂律行为更复杂——这也是实践中拟合 Scaling Law 最容易出错的地方:不同方法(固定模型规模变 token 预算、IsoFLOP 剖面、参数化拟合)会得出不同结论;Kaplan 与 Chinchilla 的经典分歧(Kaplan 偏向更多参数、Chinchilla 偏向更多数据)本质上就是「在数据无限区用不同拟合方法外推」的分歧。用玩具模拟来验证拟合方法、小心对待外推区间之外的点、理解幂律背后的机理,是「谨慎」二字的全部含义。

**为什么值得谨慎。** Scaling Law 是资源分配决策(买多少 GPU、采多少数据、预训练多久)的数学依据,拟合方法的选择会直接改变结论的数量级。理解它的推导、假设与失效边界,比记住「6ND 或 Chinchilla 最优」这类结论更重要——这也是「Carefully」标题的用意。

阅读价值

对预训练与算力规划团队,这是一份 Scaling Law 的「防坑手册」:三段论框架、Kaplan/Chinchilla 分歧的根源、数据有限区的复杂性都讲清了;对研究者,从 Amari 到 Hestness 到 Rosenfeld 的谱系梳理,让「幂律为什么成立」有了更完整的数学与经验证据链。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://lilianweng.github.io/posts/2026-06-24-scaling-laws/