中文精炼导读
核心观点
- Lilian Weng 综述了"用扩散模型做视频生成":视频任务是图像的超集(图像就是 1 帧的视频),它额外要求跨帧的时间一致性——这天然要求模型编码更多的世界知识;而且高质量、高维的视频数据(以及文本-视频对)比文本或图像难收集得多。
- 基础采样上,视频扩散常用 v-parameterization(预测 v = α_t·ε − σ_t·x,源自 Salimans & Ho 的角坐标技巧):相比 ε-parameterization,它被证明有助于避免视频生成中的颜色偏移。
- 从零建模的架构仍是两大家族:3D U-Net(Google 的 VDM、Imagen Video 等)与 Transformer/DiT(OpenAI 的 Sora);VDM 用"重建引导"(reconstruction guidance)条件化采样第二段视频,支持自回归扩展视频长度或补帧插帧。
- 更主流的路线是"把图像模型改造成视频模型":在预训练图像生成器上做视频微调——Video LDM 冻结图像骨干、只微调新加入的时间层(temporal attention / 3D 卷积残差块),并给自动编码器解码器加时间层 + 跨帧判别器消除闪烁伪影;SVD 强调数据集策展(剪辑检测、CoCa/V-BLIP/LLM 三重字幕、按光流/OCR/美学分数过滤)在模型质量中的作用;Lumiere 的 STUNet 在时间与空间上同时下采样、一次生成整个视频时长、去掉时间超分(TSR)依赖。
- 令人意外的是"免训练适配"也可行:Text2Video-Zero 不训练任何参数,用两个机制把预训练文本到图像模型变成视频生成器——用带运动动态的潜码序列采样保持全局场景与背景时间一致,以及把帧级自注意力改造成"每帧对第一帧"的跨帧注意力以保留前景对象的外观与身份。

内容精讲
文章先说明视频任务的挑战。扩散模型在图像合成上成绩斐然,现在研究社区转向更难的任务——视频生成。视频是图像的超集(图像是 1 帧的视频),挑战在于:跨帧的时间一致性有额外要求、自然需要模型编码更多世界知识;与文本或图像相比,更难收集大量高质量、高维的视频数据(更别说文本-视频对)。作者要求读者先读她的《What are Diffusion Models?》作为预备。
"从零建模"部分讲基础参数化与采样。设 x 从真实数据分布采样,逐步加高斯噪声得到 {z_t | t=1..T}(t 越大噪声越多、q(z_T) ~ N(0,I)),前向过程是高斯的,由可微噪声调度 α_t、σ_t 定义。用对数信噪比 λ_t = log(α_t²/σ_t²) 可表示 DDIM 更新。v-parameterization(v = α_t·ε − σ_t·x)由 Salimans & Ho(2022)提出,通过角坐标技巧推导:定义 φ_t = arctan(σ_t/α_t),则 α_φ = cosφ、σ_t = sinφ、z_φ = cosφ·x + sinφ·ε,速度 v_φ = cosφ·ε − sinφ·x;DDIM 更新在角坐标里就是"沿 −v̂_φ 方向移动"。对视频生成,v-parameterization 被证明比 ε-parameterization 更能避免颜色偏移。视频生成还需要模型运行多步上采样来延长视频长度或提高帧率,这要求能条件化采样第二段视频 x^b ~ p_θ(x^b|x^a)(x^b 可以是 x^a 的自回归扩展,也可以是低帧率视频缺失的中间帧)。VDM(Video Diffusion Models;Ho & Salimans et al. 2022)提出"重建引导"方法:调整去噪模型使 x^b 的采样能正确条件于 x^a——用 E_q[x_b|z_t, x^a] = E_q[x^b|z_t] + (σ_t²/α_t)·∇log q(x^a|z_t) 并加权重 w_r(>1 改善样本质量);同一方法还能同时条件于低分辨率视频把样本扩展到高分辨率。
模型架构上,与文本到图像类似,U-Net 与 Transformer 是两种常见选择:Google 有一系列基于 U-Net 的视频扩散论文(VDM 把 2D U-Net 扩展成 3D U-Net,每个特征图表示 4D 张量:帧×高×宽×通道),而 OpenAI 的 Sora 用 Transformer 架构。

"把图像模型改造成视频模型"是最主流的路线。Tune-A-Video 展示如何高效微调文本到图像模型生成视频:只微调新加的整个时间自注意力层、以及空间-时间注意力与交叉注意力的查询投影(保留既有文本到图像知识),ST-Attn 改进时空一致性、Cross-Attn 细化文本-视频对齐。Gen-1(Runway;Esser et al. 2023)针对"按文本编辑给定视频":把视频的条件生成分解为结构与内容 p(x|s,c)——内容 c 是外观与语义(用帧的 CLIP 嵌入表示,与结构特征大体正交),结构 s 是几何与动态(用深度估计或人体姿态/面部关键点等任务特定侧信息),训练时结构变量与扩散潜变量拼接、内容变量在交叉注意力层提供;架构改动是标准的一维时间卷积/一维时间注意力块插入。Video LDM(Blattmann et al. 2023)先训练 LDM 图像生成器、再微调出带时间维的视频生成:只微调新增的时间层(与既有冻结的空间层交错),输入序列 T 被解释成一批图像(B·T)给图像骨干、再重塑成视频格式给时间层,有跳跃连接用学习到的合并参数 α 结合时间输出与空间输出;时间混合层有两种:时间注意力与基于 3D 卷积的残差块。它还要解决 LDM 预训练自动编码器"只见过图像没见过视频"的问题——朴素用它会产生闪烁伪影、缺乏时间相干性,于是给解码器加额外时间层、用基于 3D 卷积的补丁式时间判别器微调(编码器保持冻结以复用预训练 LDM),冻结编码器逐帧独立处理、用跨帧判别器强制跨帧的时间相干重建。

Stable Video Diffusion(SVD;Blattmann et al. 2023)架构与 Video LDM 类似(LDM + 每层空间卷积与注意力后插入时间层),但 SVD 微调整个模型。视频 LDM 训练分三阶段:文本到图像预训练很重要(同时改善质量与 prompt 跟随);视频预训练最好单独进行、在更大规模、策展过的数据集上;高质量视频微调用较小但高视觉保真度、预加字幕的视频集。SVD 特别强调数据集策展的关键作用:用剪辑检测流水线得到更多剪辑、用三种字幕器(CoCa 做中帧、V-BLIP 做视频字幕、LLM 基于前两者做字幕),再通过去除低运动(2fps 下光流分数低)、过多文字(OCR 检测)与低美学价值(用 CLIP 嵌入标注每剪辑首中尾帧、计算美学分数与文本-图像相似度)继续改进数据集——实验显示即使数据集小得多,过滤后的高质量数据集也带来更好的模型质量。Lumiere(Bar-Tal et al. 2024)用空间-时间 U-Net(STUNet)一次生成整个视频时长、去掉时间超分(TSR)组件:STUNet 在时间与空间两个维度下采样视频,昂贵计算发生在紧凑的时间-空间潜空间;它把预训练文本到图像 U-Net 膨胀为能在时间与空间同时上下采样的版本,卷积块由预训练文本到图像层 + 分解的空间-时间卷积组成、注意力块(最粗 U-Net 层)由预训练文本到图像层 + 时间注意力组成,进一步训练只作用于新加层;空间超分(SSR)因内存限制只能作用于短的、重叠的视频片段。
"免训练适配"是最令人惊讶的部分。朴素地随机采样潜码序列再解码成视频,无法保证对象与语义的时间一致性。Text2Video-Zero(Khachatryan et al. 2023)用两个机制实现零样本、免训练的视频生成:其一,用"带运动动态的潜码序列采样"保持全局场景与背景时间一致——定义方向 δ 与超参 λ 控制全局运动量,先随机采样第一帧潜码、用预训练图像扩散模型(如 Stable Diffusion)做 Δt 步 DDIM 反向更新,对序列中每帧应用由 δ^k = λ(k−1)δ 定义的 warp 平移得到变换后的潜码、再对各帧做 DDIM 前向更新得到完整潜码序列;其二,把预训练 SD 模型的帧级自注意力改造成"每帧对第一帧"的跨帧注意力机制——Cross-Frame-Attn(Q^k, K^{1:m}, V^{1:m}) = Softmax(Q^k(K¹)ᵀ/√c)V¹,目的是在整个生成视频中保留前景对象的外观、形状与身份信息。
阅读价值
适合视频生成研究者、扩散模型工程师与对 Sora 类系统原理感兴趣的读者:这篇综述把"从零建模(v-parameterization、重建引导、3D U-Net/DiT)"、"图像模型改造(Tune-A-Video、Gen-1、Video LDM、SVD、Lumiere)"与"免训练适配(Text2Video-Zero 的潜码运动采样与跨帧注意力)"三条路线完整串联,并给出数据集策展、时间一致性等关键工程要点;是理解视频扩散全貌的高密度参考。
本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: https://lilianweng.github.io/posts/2024-04-12-diffusion-video/