核心观点

内容精讲

扩散模型是当前最强大的生成工具之一,尤其擅长图像生成、分子发现这类需要复杂局部结构的任务。它展现了一个令人兴奋的能力:在真实图像数据集上训练后,能把随机噪声样本变成全新的高质量图像——这就是所谓的「创造力」。但一个问题始终悬而未决:这份创造力到底从哪来?理解这一点,是揭开扩散式生成式 AI「黑箱」的关键一步。

**先看模型被训练成什么样。** 训练扩散模型的起点,是把真实数据样本(比如猫的照片)刻意注入噪声,直到完全无法辨认。然后训练模型逐步逆转这一破坏过程,从纯噪声还原出逼真图像——这个过程叫去噪。如果模型仅凭训练样本就把去噪学得完美无缺,那么部署时它只会输出训练集的「复刻品」,即记忆化(memorization)——此时模型是检索工具,而不是能产出新内容的创作引擎。实践中扩散模型通常做得更多:它泛化了,生成新样本。

**理解去噪的物理直觉。** 把随机噪声想象成散布在房间里的一团气体粒子,一个「力场」把每个粒子朝特定方向拉扯,直到它们聚成有意义的形状。扩散模型里,移动的粒子是正在去噪的各个数据点,「力场」就是 score 函数——由训练数据学得,决定粒子在任何时刻该流向何处。如果依赖从训练数据完美学到的 score 函数,力场会把粒子推入与训练数据点完全重合的位置,即记忆化。

**创造力来自 score 平滑。** 研究发现,扩散模型的创造力源自神经网络学习的近似性质:训练中不完美的正则化(如权重衰减)会自然地模糊掉学到的 score 函数,这一过程叫 score smoothing。平滑之后的 score 函数使去噪过程生成落在训练点「之间」的数据——在数据点之间插值,于是产生了新颖而合理的样本。

**一维例子把机制摊开。** 想象一个一维世界,只有两个训练数据点:+1 和 -1。去噪后期,「完美」score 函数在两个点中间有一个急剧的符号反转——0 附近拉力方向快速切换,空间被几乎锐利地一分为二:左侧粒子被拉向 -1,右侧被拉向 +1,最终所有粒子收敛到两个训练点之一,记忆化发生。但实际模型拿不到「完美」score 函数,它用的是神经网络学到的近似版本。因为权重衰减带来的正则化效应,神经网络难以学习这种陡峭悬崖式的函数,更倾向于学到平滑版本——把陡降软化成缓坡。实验用两层 ReLU 网络配合 AdamW 优化器、施加不同程度权重衰减来拟合一维 score 函数:正则化越强,中间区域学到的 score 函数越平滑,该区域粒子流动更慢,最终停留在两个训练点之间的「插值带」内。

**平滑不只是权重衰减的功劳。** 研究还发现,即使没有显式正则化策略,梯度优化算法训练神经网络时产生的隐式正则化同样会导致 score smoothing——这一点在 Vastola(ICLR 2025)、Wang 与 Pehlevan(NeurIPS 2025)等多项工作中以不同技术手段被独立观察到。论文将这些现象统一到同一个理论框架下。

**从一维到高维流形。** 现实世界的复杂数据(如高分辨率图像)生活在高维像素空间中,但它们并非均匀分布,而是集中在更低维的隐式数据流形上。score smoothing 的插值效应恰恰能促进流形恢复:去噪过程沿着流形在训练点之间「行走」,生成的新样本既是流形上的合理点、又区别于任何单个训练样本。创造力因此不是越狱行为,而是平滑学习对数据分布几何的自然利用。

阅读价值

对生成式 AI 研究者,这是一份把「创造力」从经验观察推进到可推导数学的框架,score smoothing 与插值带的分析可直接指导正则化策略;对工程实践者,它解释了为什么调低权重衰减会走向记忆化、调高则生成过拟合样本,为超参数选择提供了理论坐标。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/