什么是扩散模型?
扩散模型(Diffusion Model)是一种生成式 AI 模型,它的工作方式非常独特:先学习如何将清晰的图片逐步加噪变成纯噪声,然后反过来学习如何从纯噪声逐步去噪还原出清晰的图片。训练完成后,给模型一个随机噪声,它就能"去噪"出一张全新的图片。
扩散模型的工作原理
正向过程(加噪):训练时,将一张真实图片逐步添加高斯噪声,经过多步(通常是 1000 步)变成完全随机的噪声图。这个过程是确定的。
逆向过程(去噪):模型学习如何反向操作——从纯噪声开始,逐步预测并去除噪声,每一步都比前一步更清晰,最终还原出完整图片。
文本引导:在训练时同时输入文本描述(如"一只橘猫坐在窗边"),模型就会学习到文字和画面内容之间的对应关系。生成时,输入文本描述,模型就能从噪声中生成符合描述的图像。
主流扩散模型产品
- ·Stable Diffusion:开源模型,社区活跃,可本地部署
- ·Midjourney:以艺术风格和美学质量著称
- ·DALL-E 3:OpenAI 产品,文本理解能力强
- ·文心一格:百度出品,中文理解优势
- ·通义万相:阿里出品,支持图生视频
扩散模型的应用
除了图像生成,扩散模型还被应用于视频生成(Sora、Runway Gen-3)、音频生成、3D 模型生成、分子设计等前沿领域,是当前生成式 AI 最热门的技术方向之一。