首页/AI 百科词条/Stable Diffusion
🧠 模型与架构

Stable Diffusion

Stable DiffusionSD稳定扩散Stable Diffusion模型SDXLStable Diffusion 3

Stable Diffusion 是 Stability AI 开发的开源文生图模型,采用潜在扩散模型(LDM)架构,因其开源、可本地部署、社区生态丰富的特点,成为全球使用最广泛的 AI 图像生成模型。


Stable Diffusion 是什么?

Stable Diffusion(简称 SD)是一种开源的文本到图像生成模型,由德国慕尼黑大学的 Runway 研究团队和 Stability AI 联合开发,于 2022 年 8 月公开发布。与 Midjourney 和 DALL-E 不同,Stable Diffusion 的模型权重完全开源,任何人都可以免费下载并在自己的电脑上运行。

核心技术

Stable Diffusion 的核心是潜在扩散模型(Latent Diffusion Model, LDM)。与直接在像素空间操作的扩散模型不同,LDM 先在 VAE(变分自编码器)压缩的潜在空间中执行去噪过程,大幅降低了计算成本。

版本演进

SD 1.4/1.5:最初版本,社区生态最为丰富。SD 2.0/2.1:改进了生成质量但社区接受度不如 1.5。SDXL:大幅提升分辨率和构图能力,支持 1024x1024 原生分辨率。SD 3:最新版本,采用 MMDiT(多模态扩散 Transformer)架构,文本理解和图像质量显著提升。

开源生态

Stable Diffusion 的开源性质催生了极其繁荣的社区生态:数以万计的 LoRA 微调模型、ControlNet 等控制扩展、ComfyUI/AUTOMATIC1111 等用户界面、以及丰富的模型分享平台(CivitAI)。


相关术语

分享: