中文精炼导读

核心观点

  • Lilian Weng 系统综述了缩放定律(scaling laws)——深度学习中最关键的实证发现之一:训练损失 L 随模型大小 N、数据集大小 D 与计算量 C 的缩放而按幂律可预测地下降(log-log 图上呈直线);它本质上是"如何在 N 与 D 之间最优分配宝贵的计算量"的框架。
  • 早期预测性研究:Amari et al.(1992)用贝叶斯方法推导出四类学习曲线(ε ~ c·D^α + E,α = -2, -1, -1/2),Hestness et al.(2017)跨四个领域(机器翻译、图像分类、语言建模、语音识别)发现泛化误差按幂律缩放、且"斜率是问题领域属性而非模型架构属性"(架构只改变偏移 E),Rosenfeld et al.(2020)进一步把误差建模为 N 与 D 的联合函数。
  • Kaplan et al.(2020)在语言建模社区普及了缩放定律:损失分别按 N、D、C 呈幂律,三者需协同放大;更大的模型样本效率更高;架构细节不如纯粹规模重要;关键结论是"给定固定算力,训练一个非常大的模型并在收敛前停住,比把较小模型训练到收敛更高效"——这正是 Chinchilla 定律不同意的地方。
  • Chinchilla(Hoffmann et al. 2022)用三种方法(固定模型尺寸变 token 预算、IsoFLOP profile、参数化拟合)得出更优的数据/参数比:约 20 个 token 对应 1 个参数;作者通过重跑 method 3 的拟合发现其轻微偏差源于实现细节(Huber 损失求平均而非求和导致优化器提前终止、早期停止等),从而调和了两者。
  • 数据受限区域的缩放更微妙:重复数据让 token 价值按指数衰减(Muennighoff et al. 2023 提出有效数据 D' = U_D + U_D·r_D(1−exp(−R_D/r_D)) 的半衰期建模;Lovelace et al. 2026 加入显式过拟合惩罚项 P·R_D^δ·(N/U_D)^κ);而现实中拟合缩放定律极其敏感——参数如何计数、精度如何舍入、损失如何求和或平均,这些看似舍入级的选择在"用小数模外推大模型"时会导致预测天差地别。
Kaplan 缩放定律
Kaplan 缩放定律

内容精讲

文章先给出核心符号:N 是模型大小(参数量)、D 是训练数据大小(token 数)、C 是训练计算量(FLOPs,近似 C ≈ 6ND,其中 2ND 是前向、4ND 是反向)、E 是不可约损失。缩放定律的实践价值在于:在少量小规模运行上拟合缩放定律、再外推估算更大模型的 token 与算力需求——这是一个常见工作流。

"早期时代:ML 损失可预测性"部分追溯了先于缩放定律的研究。Amari et al.(1992)用贝叶斯方法与退火近似推导出四类学习曲线:确定性算法 + 无噪声数据 + 唯一解(ε ~ c·D⁻¹);确定性算法 + 无噪声 + 多个等价解(ε ~ c·D⁻²,学习更快因为只需学参数最优流形);确定性算法 + 有噪声数据(ε ~ c·D^(-1/2));随机算法 + 有噪声数据(ε ~ c·D⁻¹ + E,E 是不可约损失)。四种都呈幂律。Hestness et al.(2017)是最早的实证研究之一:跨四个领域发现泛化误差随数据规模按幂律缩放、模型改进只移动误差曲线而不改变幂律指数、架构改变偏移 E 但不改变指数——幂律斜率是问题领域的属性而非模型架构的属性。Rosenfeld et al.(2020)把误差建模为 N 与 D 的联合函数:固定一个轴时误差在另一个轴上按幂律衰减,组合成 L̂(D,N) ≈ A/N^α + B/D^β + E,并展示了在小组配置上拟合、外推到更大模型/数据区域的预测。作者还补充了一个旁注:这些早期工作借用 VC 维等经典学习理论直觉,但现代深度学习中 VC 维往往太粗、实证幂律比最坏情形界干净实用得多。

"数据无限区域的缩放定律"聚焦 Kaplan 与 Chinchilla。Kaplan et al.(2020)在语言建模社区普及了缩放定律:交叉熵测试损失 L 分别与 N(不含嵌入层)、D、C 在多个数量级上呈幂律。关键发现:损失分别按 N、D、C 呈幂律,三者需协同放大;训练曲线遵循参数近似与模型大小无关的可预测幂律;更大模型样本效率更高(更少的优化步与数据点达到给定损失);架构细节不如纯粹规模重要;训练损失与测试损失正相关;以及"给定固定算力,训练超大模型并提前停止比训练小模型到收敛更高效"——作者指出这正是 Chinchilla 不同意的地方(Kaplan 拟合出的指数偏大、高估了最优模型大小)。Kaplan 还给出联合形式 L̂(N,D) = [(a/N)^(α/β) + b/D]^β,其好处是过拟合程度主要取决于 N^(α/β)/D 的比值——数据需随模型增长按特定比例增长。

Chinchilla 缩放定律
Chinchilla 缩放定律

Chinchilla(Hoffmann et al. 2022)用三种方法重新评估最优计算分配:方法一固定模型尺寸、变化 token 预算;方法二画 IsoFLOP profile(在固定算力下找最优 N/D 组合);方法三做参数化拟合。结论是约 20 个 token 对应 1 个参数。作者专门讨论了"调和 Kaplan 与 Chinchilla":Chinchilla 的 method 3 与其他两种方法有轻微偏差,Besiroglu et al.(2024)提取原文数据重跑 method 3 拟合,发现几个具体问题——L-BFGS-B 最小化器中的高损失尺度(因对样本求平均而非求和 Huber 损失导致优化提前终止)、早期停止的影响、以及一些其他实现细节。修正这些问题后,三种方法得到更一致的结论。关于"为什么是幂律",作者列出了几种假设:双指数混合(语言"技能"的难度分布按幂律,模型先学常见技能、后学稀有技能,产生平滑幂律衰减)、数据谱尾、核特征值、自然语言统计、训练动态中的相变等。

"数据受限区域的缩放定律"是本文的独特贡献。经典缩放定律假设有效无限的唯一数据(无重复、无多 epoch 训练),但随着模型大幅增长,我们正在耗尽足够的高质量唯一 token——"数据墙"之争就围绕这一点。作者强调 D 背后的数据集应已被清理(去重、质量过滤、去样板、安全过滤、PII/版权掩码、基准去污染、按语言/质量/内容类型重新加权数据混合)——即便两个数据集 token 数相同,高质量与"互联网垃圾"的算力效率天差地别。Hernandez et al.(2022)做受控研究:从大数据集保留 90% 不重复、把剩下 10% 换成一小部分原数据的重复,训练 100B token 观察到"双下降"现象——测试损失随重复数据的强调程度"变差再变好",重复占比越大效应越明显;平坦或上升的训练中段可能源于对重复数据的记忆,这种形状让缩放定律拟合更不准,且重复数据损害部分 OOD 评估与下游微调。Muennighoff et al.(2023)研究"数据受限时计算如何最优分配":约 400 个实验(10M–9B 参数、数据最多 900B token、最多 1500 epoch),把总 token 数 D 分解为唯一 token 数 U_D 与重复次数 R_D(D = U_D(1+R_D)),引入有效数据 D' = U_D + U_D·r_D(1−exp(−R_D/r_D))——直觉是 token 的价值随重复按指数衰减、每个重复消耗 token 剩余价值的 (1−1/r_D) 比例,r_D 是可学习的"半衰期";对称地处理过大的模型 N'。Lovelace et al.(2026)用不同方法重访:显式建模模型大小与数据重复的交互,训练约 300 个模型,发现"更多 epoch 造成更多伤害、且更大模型对重复更敏感",并引入显式过拟合惩罚项 L̂ = E + A/N^α + B/(U_D(1+R_D))^β + P·R_D^δ·(N/U_D)^κ(随重复次数与相对唯一数据的过参数化程度增长);他们的拟合还发现超参数衰减比重复数据衰减更快(r_N < r_D),建议把更多资源花在更多 epoch 而非更多参数上;强 weight decay 能减少重复导致的过拟合惩罚。作者提醒这些建模都来自经验曲线拟合,"为什么数据受限缩放定律恰好是这个形式、为什么需要每个自由参数"仍不清楚。

最后的"现实中拟合缩放定律的诡计"强调了实践脆弱性:拟合只基于能负担得起的(相对小、相对便宜)模型,预测却外推几个数量级更大的模型,于是"看起来像舍入误差的选择"(参数如何计数、精度如何舍入、损失如何求和或平均)可能导致预测天差地别;且拟合假设唯一变化的因素是规模(架构、优化器、学习率调度、batch ramp、数据混合、tokenizer 等应保持不变),并要求这些设置都经过仔细调优——未充分训练的模型会得出不同结论。Kaplan 与 Chinchilla 的分歧本身、以及 Besiroglu 重跑 method 3 发现的问题,都是"拟合敏感性"的鲜活案例。

阅读价值

适合大模型训练负责人、算力规划者与想理解"为什么模型该配多少数据"的研究者:这篇文章把缩放定律从早期预测性工作到 Kaplan/Chinchilla、再到数据受限区域(重复数据、有效数据建模、过拟合惩罚)与拟合陷阱完整串联,尤其"20 token 每参数""重复数据按指数衰减""拟合对实现细节极其敏感"这些要点对实际训练决策非常实用。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://lilianweng.github.io/posts/2026-06-24-scaling-laws/