中文精炼导读

核心观点

  • Google Research 的 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》从数学上解释了扩散模型的"创造力"从何而来:它不是随机的侥幸,而是神经网络学习"平滑化"的分数函数(score function)的自然结果。
  • 核心机制是"分数平滑"(score smoothing):受训练正则化(如 weight decay)影响,神经网络难以学到完美分数函数那些陡峭的"悬崖",只能学到更平滑的近似版本,这使去噪过程不再让数据坍缩到训练样本上,而是落在训练数据点之间——即沿隐藏的数据流形做插值,生成新颖而合理的样本。
  • 完美的分数函数会驱动粒子精确复刻训练数据点,导致"记忆化"(memorization);现实中模型的创造力恰恰来自这种"不完美"——模型在已知数据点之间架起了桥梁。
  • 分数平滑对质量与新颖性的平衡是方向相关的:沿数据流形切向方向它减缓粒子坍缩到训练点,而沿指向流形的方向几乎不影响收敛,因此图像既真实(到达了有意义的数据流形)又新颖(落在了原始训练数据点之间的空白处)。
  • 结论具有预测性:在图像生成或药物发现中,扩散模型不是记住两张猫图或两个分子,而是探索它们周围的空间,提出融合两者痕迹的全新图像或分子构型。
一维示例:分数平滑产生的"插值区"
一维示例:分数平滑产生的"插值区"

内容精讲

扩散模型是目前生成需要复杂局部结构数据(如图像生成、分子发现)的最强工具之一,它们展现出超越训练数据、堪称"创造力"的泛化能力——用真实图像数据集训练后,能把随机噪声样本转化为新颖的高质量图像。但一个问题始终悬而未决:这种创造力从哪来?理解它,是揭开扩散式生成式 AI"黑箱"本质的重要一步。

文章先建立"去噪"的概念框架。训练扩散模型的第一步,是拿一批真实训练样本(比如猫的照片),故意用噪声污染它们直到完全无法辨认;然后训练模型逐步逆转这个过程,从纯噪声重建出逼真的图像——这被称为去噪(denoising)。如果模型能仅基于训练样本完美学会去噪,部署时它就应该产出训练样本的复制品,这种行为叫"记忆化"——此时模型是检索工具,而不是能产生新颖输出的创作引擎。但实践中扩散模型通常不止于记忆,它们会泛化、生成新样本。

作者用一个物理意象帮助理解:把随机噪声想象成一屋子散射的气体粒子,一个"力场"把每个粒子拉向特定方向,直到它们聚成有意义的形状。在扩散模型里,移动的粒子是被去噪的单个数据点,"力场"就是分数函数(SF)——它从训练数据中学得,指示粒子在任何时刻应向哪里流动。如果模型依赖一个从训练数据完美学到的分数函数,力场会把粒子精确驱赶到训练数据点的位置,即记忆化。

论文的核心发现来自一个一维示例。假设世界上只有两个训练数据点:+1 和 -1。在去噪过程的后期,"完美"分数函数是一条在两点之间陡峭改变符号的曲线——在 0 附近方向迅速切换,整个空间几乎被清晰地分成两半,左侧粒子被拉向 -1、右侧被拉向 +1,最终所有粒子都收敛到两个训练数据点之一,即记忆化。但实际扩散模型拿不到"完美"分数函数,只能拿到神经网络学到的近似版本。由于训练中 weight decay 的正则化效应,神经网络难以学到带这种陡峭悬崖的函数,倾向学到"完美"分数函数的更平滑版本,把陡峭下降软化成一个平缓斜坡。

完美分数函数驱动记忆化 vs 平滑分数函数驱动插值
完美分数函数驱动记忆化 vs 平滑分数函数驱动插值

作者设计了一个实验来验证:用两层 ReLU 神经网络在一维示例上拟合分数函数,用 AdamW 在不同程度的 weight decay(WD)下优化。结果显示,正则化下训练出的网络学到的分数函数更平滑,weight decay 越强,中间区域学到的分数函数越平滑——意味着该区域的粒子流动更慢,最终会"栖息"在两个训练数据点之间的"插值区"里。论文把神经网络正则化的函数空间理论(Savarese et al., COLT 2019)与去噪的数学相结合,量化了这种关联;实验还表明,即使没有 weight decay 这类显式正则化,梯度型算法训练神经网络的隐式正则化同样会产生分数平滑(Vastola、Wang & Pehlevan、Bonnaire 等用不同技术研究过)。

真实世界的数据要复杂得多:高分辨率图像活在高维像素空间里,但那个空间的绝大部分只是对人眼毫无意义的随机噪声;只有一小部分数据点对应可识别的图像,它们分布在被称为"数据流形"(data manifold)的薄片结构中。数据流形的形状和位置模型事先并不知道,因此图像生成可以被看作一项"流形恢复"任务:模型需要基于从流形上采样的有限训练数据,推断隐藏数据流形长什么样,再在流形上找出对应新颖而有意义图像的新点。

分数平滑对完成这个任务至关重要,而且它在多维设置中的效应是方向相关的。沿与数据流形平行的("切向")方向,它产生与一维情形类似的减速效应;但沿指向流形的方向,"完美"分数函数本来就相对平滑(如果流形是平坦的,它其实就是一条直线),进一步平滑影响不大。因此,分数平滑不是在每个方向都给粒子踩刹车(那样会让它们滞留在嘈杂的空白空间、导致最终图像模糊),而是不减缓它们向流形的收敛,只沿切向方向降低它们坍缩向训练数据的倾向。这样一来,模型在质量与新颖性之间取得平衡:图像既真实(成功到达有意义的数据流形),又新颖(落在原始训练数据点之间的空白处)。

多维中分数平滑近似实现流形学习(插值动图)
多维中分数平滑近似实现流形学习(插值动图)

作者的结论是:所谓扩散模型的"创造力"实际上是一个可预测的数学结果。因为神经网络永远不会"完美地尖锐",它们会在已知数据之间架起插值的桥梁。在图像生成或药物发现中,这意味着扩散模型不只是记住被展示的两张不同猫图或两个药物分子,而是探索它们周围的空间,提出结合两者痕迹的第三张全新图像或全新的分子构型。这项工作只是阐明该机制的初步努力,已有其他研究者继续研究数据分布或网络架构变得更复杂、以及条件生成任务中的情况。通过展示这种行为根植于神经网络的学习方式,研究者可以开始有意构建它——把"创造力"从玄学变成可设计的性质。

阅读价值

适合生成式 AI 研究者、机器学习理论爱好者,以及想理解"扩散模型为什么能创作而不是复读"的开发者:文章用一维示例、清晰的物理想象和方向相关的流形分析,把"创造力=分数平滑的插值效应"这个结论讲得既严谨又直观;配图(含动图)对建立直觉非常有帮助,是理解扩散模型泛化机制的理想入门。

阅读英文原文 → 返回 AI 技术文档

本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/