我的歌单

Diffusion 是什么:从加噪、去噪到今天的生图与视频模型

发表于
更新于
字数: 1.1k
时长: 7m
阅读: -
玉门

Diffusion 到底是什么

Diffusion,中文常译作扩散模型,是这一轮 AI 生图浪潮里最关键的技术路线之一。它的名字听起来像物理课里的分子扩散,但放到生成模型里,可以先把它理解成一种“学会从混乱中还原秩序”的方法。

如果给你一张猫的照片,我们可以一点点往里面加入随机噪声:第一步只是有点颗粒感,继续加就越来越花,最后变成一张几乎没有意义的雪花图。扩散模型训练时做的事情,就是反过来学习:看到一张被噪声污染的图,判断它原本可能长什么样,并一步一步把噪声擦掉。

经典 DDPM 论文把这个过程写得很系统:正向过程负责逐步加噪,反向过程由神经网络学习去噪。训练时模型并不是凭空“想象艺术”,而是在大量图像和文字说明中学习:某种噪声状态下,哪些像素结构、边缘、颜色和语义更可能组成一张合理图片。

从加噪到去噪的直观理解

我们可以把扩散想成修复一张被雾气遮住的照片。开始时,画面什么都看不清;模型每一步只做一件小事:预测这团混乱里哪一部分更像噪声,哪一部分更像真实图像。它不需要一步画完整幅图,而是通过几十步甚至上百步迭代,让画面逐渐清晰。

这也是扩散模型质量高的原因之一。它把一个极难的问题拆成很多个较容易的问题:不要一次性生成完美图像,而是不断微调当前结果。早期 GAN 也能生成图像,但训练容易不稳定;扩散模型虽然采样慢一些,却在细节、稳定性和多样性上表现得很强。

当然,去噪不是简单的滤镜。滤镜只能处理已有图片,而扩散模型可以从纯噪声开始生成新内容。提示词会告诉它“这团噪声应该往哪个方向收敛”:是山谷、城市、人物肖像,还是一张产品渲染图。

Latent Diffusion:为什么不直接在像素上画

如果直接在高清像素空间里扩散,计算量会非常大。图像越大,像素越多,模型每一步要处理的信息就越重。Stable Diffusion 这类模型能够流行,一个重要原因是 Latent Diffusion 论文提出了更实用的做法:不要总在原始像素里工作,而是先把图片压缩到一个较小的潜空间,也就是 latent space。

潜空间可以理解为图像的“语义草稿层”。编码器把图片压缩成更紧凑的表示,扩散模型在这个表示上加噪和去噪,最后再由解码器还原成像素图。这样既节省显存和算力,又能保留足够的视觉语义。

这解释了为什么同样是输入一句话,模型可以较快生成一张复杂图片:它不是从左到右逐像素画出来,而是在压缩后的语义空间里塑形,再翻译回我们能看的图像。

DiT、Flow Matching 与视频生成

早期扩散模型常用 U-Net 作为去噪网络,因为 U-Net 擅长处理图像的多尺度结构:既看整体构图,也看局部细节。后来,Transformer 的影响进入视觉生成领域,DiT,也就是 Diffusion Transformer,把扩散过程里的去噪网络换成更接近 Transformer 的结构。好处是它更容易吃下大规模数据和算力,也更适合与文本、图像、视频等多模态信息融合。

Flow Matching 则可以看作另一种描述“如何从噪声走向数据”的训练框架。扩散模型通常强调逐步去噪,Flow Matching 更关注学习一条从简单分布流向真实数据分布的速度场。通俗说,它不只问“这一步该擦掉多少噪声”,也问“当前点应该朝哪个方向移动,才能变成合理样本”。在今天的图像和视频模型里,这类方法常与 Transformer 架构、条件控制和大规模训练结合出现。

视频生成比生图更难,因为它不只要每一帧好看,还要帧与帧之间连贯:人物不能忽然换脸,镜头运动不能抖成碎片,物体也要遵守某种时间上的连续性。因此,视频模型通常需要同时理解空间结构和时间结构。扩散、DiT 与 Flow Matching 的共同作用,是让模型能在更高维的时空数据里逐步生成内容。

为什么提示词与控制条件重要

扩散模型从噪声出发,可能生成的结果太多了。提示词、参考图、姿态骨架、深度图、边缘图、遮罩、相机运动说明,本质上都是控制条件:它们把“无数可能”收窄到用户真正想要的方向。

提示词负责语义约束,比如主体、风格、材质、光照和构图;参考图负责身份、布局或风格一致性;ControlNet 一类方法则能把边缘、姿态、深度等结构信息注入生成过程。越复杂的任务,越不能只靠一句“画得好看”。专业工作流往往会把提示词、草图、局部重绘、放大、颜色校正和人工筛选组合起来。

这也和 Agent 工作流相似:模型不是魔法盒,而是一个可以被上下文、工具和反馈约束的系统。关于 Agent 如何规划、调用工具和校验结果,可以看另一篇《Agent 工作流是什么》。

常见局限

扩散模型很强,但并不等于理解世界。它可能画错手指、文字、镜像关系和精密机械结构,也可能在长视频里出现身份漂移、物体穿模、因果关系混乱。它学到的是数据分布中的统计规律,不是严格的物理引擎。

版权和风格模仿也是现实问题。模型可能从训练数据中学到某些艺术家、品牌或人物的视觉特征,使用时需要注意授权、肖像权和平台规则。另一个局限是可控性:同一句提示词多次生成会有差异,想稳定复现结果,需要种子、参考图、控制条件和后期流程配合。

所以,Diffusion 最适合被理解为一种强大的生成与编辑基础能力。它让机器能从噪声中合成图像和视频,但真正把它用于设计、影视、游戏或内容生产时,还需要人的审美判断、流程管理和责任边界。

延伸阅读