扩散模型原理详解:AI 图像生成的加噪去噪流程与应用
扩散模型是一类生成模型,常用于 AI 图像生成和计算机视觉。它通过加噪、噪点预测和反向扩散生成内容,帮助理解原理、应用与 Stable Diffusion 示例。

什么是扩散模型?
扩散模型是一类生成模型,常用于 AI 图像生成和其他计算机视觉任务。它也是生成式 AI 的一种技术路线:模型通过神经网络从已有数据中识别模式和结构,再生成新的内容。
在 AI 图像生成中,可以把扩散模型理解为一种学习“如何从杂乱噪声中逐步恢复图像结构”的模型。它并不是简单地给图片添加噪声,而是通过训练学习数据中的规律,并在生成阶段利用反向过程形成新的内容。
本文聚焦扩散模型的基本定义、加噪与去噪流程,以及它和生成式 AI、Stable Diffusion 的关系;不展开具体模型版本、训练数据规模、推理成本或商业化能力。
用加噪和去噪理解扩散模型
扩散模型的直觉来自两个相反的过程:先让清晰数据逐步变得嘈杂,再学习如何沿相反方向恢复有结构的内容。在图像场景中,扩散模型可以使用高斯噪点对图像进行编码,使原始图像在多次扰动后越来越接近随机噪声。
| 过程 | 作用 | 在图像生成中的含义 |
|---|---|---|
| 正向扩散 | 逐步添加噪声 | 清晰图像被随机噪声扰动 |
| 学习反转 | 学习噪声与结构之间的关系 | 模型获得从噪声中恢复图像结构的能力 |
| 反向扩散 | 逐步去噪 | 从噪声出发,生成或重现图像 |
要点:扩散模型的关键不只是“加噪”,而是让模型学习如何反转加噪过程。生成图像时,模型依靠反向扩散过程逐步形成可识别的视觉内容。
扩散模型生成图像的核心流程
扩散模型生成图像通常可以理解为“正向扩散、学习反转、反向扩散”三个阶段。这个过程帮助模型从已有数据中学习结构,再从噪声中逐步生成新的图像。
正向扩散:逐步向数据添加噪声
正向扩散会向原始样本逐步加入随机噪声,使图像中的可见结构不断被扰动。这个过程让模型接触到图像从清晰到嘈杂的变化路径。
训练目标:学习预测和处理噪声
训练阶段,模型学习噪声与原始数据结构之间的关系。扩散模型可以使用噪点预测器,并结合反向扩散过程来重现图像;因此,理解噪点预测有助于理解后续的生成过程。
反向扩散:从噪声中逐步形成图像
生成阶段通常不是从一张现成图像开始,而是从噪声状态出发,沿着模型学到的反向路径逐步去噪。经过多次去噪后,噪声中的结构逐渐变得清晰,最终形成新的图像内容。
| 步骤 | 发生了什么 | 读者可以关注什么 |
|---|---|---|
| 1 | 输入或准备训练数据 | 数据中的视觉结构为模型学习提供基础 |
| 2 | 向数据逐渐加噪 | 清晰样本被随机噪声扰动 |
| 3 | 学习反转过程 | 模型学习如何处理噪声并恢复结构 |
| 4 | 执行反向扩散 | 从噪声状态逐步去噪 |
| 5 | 生成图像 | 输出新的视觉内容 |
扩散模型与生成式 AI 的关系
生成式 AI 是上位概念,指使用神经网络识别现有数据中的模式和结构,并据此生成新内容的模型体系。扩散模型是其中一种生成模型路线,尤其常被用来解释 AI 图像生成的工作方式。
生成式 AI 可以使用无监督学习、半监督学习等方法。扩散模型的生成对象也不必只限于图像,已有资料支持它可生成文本、图像或声音等数据类型;不过在入门理解中,图像生成通常是最直观的入口。
| 概念 | 范围 | 与扩散模型的关系 |
|---|---|---|
| 生成式 AI | 更大的模型体系 | 通过神经网络识别数据模式并生成新内容 |
| 扩散模型 | 生成模型的一类方法 | 通过加噪、学习反转和反向扩散生成内容 |
| AI 图像生成 | 具体应用场景 | 扩散模型常用于图像生成和相关计算机视觉任务 |
Stable Diffusion 是扩散模型的一个示例
Stable Diffusion 属于扩散模型,可以作为理解扩散模型工作方式的具体示例。它与扩散模型基本机制的对应关系在于:图像会与噪声表示相关,模型通过噪点预测器和反向扩散过程逐步形成或重现图像。
需要注意的是,Stable Diffusion 不是扩散模型的全部。更准确的说法是:Stable Diffusion 是扩散模型的一种具体实现或示例,而扩散模型是更宽泛的模型类别。
AI 图像生成中的主要应用场景
在 AI 图像生成中,扩散模型的价值主要体现在对视觉结构的学习和生成能力上。它可以基于学习到的数据模式生成新的视觉内容,也可以作为理解生成式视觉能力的重要技术基础。
| 用户需求 | 解决方式 | 可能带来的效果 |
|---|---|---|
| 生成新的视觉内容 | 使用扩散模型学习图像数据中的结构,再通过反向扩散生成图像 | 获得新的图像输出 |
| 理解计算机视觉中的生成能力 | 将扩散模型作为图像生成和相关视觉任务的一类生成模型来理解 | 建立对生成式视觉任务的技术认知 |
| 评估多类型内容生成 | 将生成对象从图像扩展到文本、声音等数据类型进行理解 | 把扩散模型放入更大的生成式 AI 框架中判断 |
理解扩散模型时常见的几个误区
扩散模型容易与噪声处理、生成式 AI 或具体模型名称混在一起。厘清这些边界,有助于更准确地阅读模型说明和技术文档。
| 常见误区 | 更准确的理解 |
|---|---|
| 扩散模型只是在图像上添加噪声 | 加噪只是正向过程,关键在于模型学习如何反转噪声过程 |
| Stable Diffusion 就是扩散模型的全部 | Stable Diffusion 属于扩散模型,但只是其中一个具体示例 |
| 扩散模型只能生成图像 | 扩散模型常用于图像生成,也可用于生成文本、图像或声音等数据类型 |
| 生成式 AI 与扩散模型是同义词 | 生成式 AI 是上位概念,扩散模型是其中一种生成模型路线 |
判断是否需要了解或使用扩散模型
如果你关注 AI 图像生成的基本原理,扩散模型是一个值得优先理解的概念。尤其当文档中出现加噪、噪点预测器、反向扩散、Stable Diffusion 等术语时,掌握扩散模型的基本流程能帮助你更快读懂相关说明。
可以用下面的清单判断是否需要进一步学习扩散模型:
- 你的目标是否是理解 AI 图像生成如何从噪声形成图像?
- 是否需要区分生成式 AI、扩散模型和具体模型示例?
- 是否关注加噪、噪点预测器和反向扩散过程?
- 生成对象是图像、文本、声音,还是其他数据类型?
- 是否涉及图像生成或相关计算机视觉任务?
- 如果问题涉及具体模型版本、训练规模、版权、安全限制或部署成本,是否已有对应的官方文档或项目资料可进一步核对?
要点:对入门读者来说,先理解“逐步加噪,再学习反向去噪”这一核心机制,比直接记忆具体模型名称更重要。