Stable Diffusion 是基于深度学习的开源文本到图像生成模型。
核心技术
Stable Diffusion
- 基于深度学习的文本到图像生成模型
- 促进 AI 技术民主化
技术原理
扩散模型基础
- 基于扩散模型的文生图技术
- 从随机噪点图像一步步去除噪点
- 根据文字指示生成图像
技术优势
- 在消费类 GPU 上运行(VRAM 低于 10GB)
- 几秒钟内生成 512x512 像素的图像
- 使研究人员和公众都可以进行文生图操作
主要功能
- 文本生成图像(text2img)
- 图像修改
- 根据草图加文本描述生成图像
- 视频生成
关键特点
- 开源
- 高效(较低配置硬件即可运行)
- 可控(通过文本提示精确控制生成结果)
- 高质量(生成逼真、高质量的图像)