首页/问答百科/扩散模型
🧠 模型与架构

扩散模型

扩散模型Diffusion Model去噪扩散概率模型DDPM

扩散模型(Diffusion Model)是一种生成式 AI 模型,通过先向数据逐步添加噪声再逆向去噪的方式学习生成新数据,是 Midjourney、Stable Diffusion、DALL-E 等 AI 绘画工具的核心技术。


什么是扩散模型?

扩散模型(Diffusion Model)是一种生成式 AI 模型,它的工作方式非常独特:先学习如何将清晰的图片逐步加噪变成纯噪声,然后反过来学习如何从纯噪声逐步去噪还原出清晰的图片。训练完成后,给模型一个随机噪声,它就能"去噪"出一张全新的图片。

扩散模型的工作原理

正向过程(加噪):训练时,将一张真实图片逐步添加高斯噪声,经过多步(通常是 1000 步)变成完全随机的噪声图。这个过程是确定的。

逆向过程(去噪):模型学习如何反向操作——从纯噪声开始,逐步预测并去除噪声,每一步都比前一步更清晰,最终还原出完整图片。

文本引导:在训练时同时输入文本描述(如"一只橘猫坐在窗边"),模型就会学习到文字和画面内容之间的对应关系。生成时,输入文本描述,模型就能从噪声中生成符合描述的图像。

主流扩散模型产品

  • ·Stable Diffusion:开源模型,社区活跃,可本地部署
  • ·Midjourney:以艺术风格和美学质量著称
  • ·DALL-E 3:OpenAI 产品,文本理解能力强
  • ·文心一格:百度出品,中文理解优势
  • ·通义万相:阿里出品,支持图生视频

扩散模型的应用

除了图像生成,扩散模型还被应用于视频生成(Sora、Runway Gen-3)、音频生成、3D 模型生成、分子设计等前沿领域,是当前生成式 AI 最热门的技术方向之一。


相关术语

分享: