先说结论
Stable Diffusion是最流行的开源AI图像生成工具——不是商业产品,是完全开源免费的。它能根据你的文字描述生成各种风格的图像,从照片级真实图像到动漫风格、油画风格、概念艺术。最大优势是完全免费、可以本地部署、数据完全私有。需要一张好的显卡(8GB显存以上),这篇从安装配置到生成第一张专业级AI图像,把每一步给你拆开。
Stable Diffusion到底是什么——别把它当Midjourney的免费替代品
Stable Diffusion跟Midjourney、DALL-E这类商业工具最大的区别是:它完全开源。不是只能用别人提供的服务——你可以在自己电脑上运行,完全控制生成过程,训练自己的模型,生成无限数量的图像。底层用的是扩散模型技术,由Stability AI开发并开源。
它的出身也有意思——Stability AI的创始人Emad Mostaque之前是做AI投资的,发现AI图像生成被几家公司垄断,价格太高、限制太多。所以他决定做一个开源的替代品——让每个人都能用上AI图像生成技术。2022年发布后迅速成为最流行的开源AI图像工具。
🔧 五步上手教程
第一步:准备硬件
Stable Diffusion需要一张好的显卡——最低要求8GB显存的NVIDIA显卡(RTX 3060、RTX 4060等)。推荐12GB显存以上(RTX 3060 12GB、RTX 4070等)。如果没有好显卡,可以用Google Colab(免费)或RunPod(付费)在云端运行。检查你的显卡:Windows按Win+R输入「dxdiag」,Mac用户需要用CPU版本(速度慢很多)。
第二步:安装WebUI
最流行的界面是AUTOMATIC1111 WebUI。去 GitHub仓库 下载——需要安装Python 3.10和Git。Windows用户可以直接下载整合包(搜索「Stable Diffusion WebUI 整合包」)。安装完运行「webui.bat」(Windows)或「webui.sh」(Mac/Linux),浏览器打开「http://localhost:7860」就能看到界面。
第三步:下载模型
Stable Diffusion本身只是一个框架,需要下载模型才能生成图像。去 Civitai 或 Hugging Face 下载模型文件(.safetensors或.ckpt格式)。推荐新手用:SD 1.5(通用)、Realistic Vision(真实照片)、DreamShaper(艺术风格)。下载完放到「models/Stable-diffusion」文件夹,刷新WebUI就能选择。
第四步:写提示词生成图像
在WebUI的「txt2img」标签页输入提示词——用英文描述你想要的图像。两个例子对比:
- ❌ 不好的:「a girl」——太简单,AI不知道你要什么风格、什么场景
- ✅ 好的:「a beautiful young woman, long black hair, blue eyes, wearing a white dress, standing in a flower field, sunset lighting, cinematic composition, 8k, highly detailed, masterpiece」
提示词结构:主体描述 + 环境/场景 + 光影/风格 + 质量词(masterpiece, best quality, 8k等)。还可以加「Negative Prompt」告诉AI不要生成什么(如:low quality, bad anatomy, blurry)。
第五步:调整参数 + 生成
右侧有多个参数可以调整:「Sampling method」选采样方法(推荐DPM++ 2M Karras)、「Steps」采样步数(20-30足够)、「CFG Scale」提示词相关性(7-9合适)、「Width/Height」图像尺寸(512×512或768×768)。调完点「Generate」开始生成——根据显卡性能,通常需要10-60秒。生成完可以在下方看到结果,右键保存。
四个真实场景——看看它能实际干什么
概念艺术设计:游戏策划说要一个「赛博朋克风格的城市夜景」——在Stable Diffusion输入「cyberpunk city at night, neon lights, rain on streets, flying cars, cinematic lighting, blade runner style, 8k, highly detailed」。生成4张不同构图的概念图——每张都能直接当美术参考。还可以用img2img功能基于草图生成,或ControlNet精确控制构图。
产品图背景替换:电商要把产品图放到不同场景——用Stable Diffusion的inpainting功能,选中产品背景区域,输入新场景描述(如「on a wooden table, kitchen background, warm lighting」),AI生成新背景,产品保持不变。手动P图要1小时,Stable Diffusion 1分钟搞定。
角色设计迭代:设计师要做角色设计——先画一个草图,用ControlNet的Scribble模式导入草图,输入详细描述,AI基于草图生成完整角色。不满意就调整提示词或草图,快速迭代。手动画10个方案要1周,Stable Diffusion 1天搞定。
训练专属模型:你有特定的艺术风格——收集20-50张你的作品,用Dreambooth或LoRA训练专属模型。训练完用这个模型生成的图会自动带上你的风格。训练需要2-4小时(取决于显卡),但之后可以无限生成。风格一致性从70%提升到95%。
价格和成本
- 软件本身:完全免费,开源(CreativeML Open RAIL-M许可证)
- 模型下载:大部分免费,少部分付费($5-$20)
- 硬件成本:需要8GB显存以上显卡(RTX 3060约2000元起)
- 云端运行:Google Colab免费(有限制),RunPod约$0.3/小时
* 价格更新于 2026-08
常见问题
Q: 跟Midjourney有什么区别?
A: Stable Diffusion完全免费、可本地部署、数据私有,但需要好显卡和学习成本。Midjourney付费、云端运行、简单易用,但数据不私有。追求自由和控制选Stable Diffusion,追求简单和效果选Midjourney。
Q: 支持中文提示词吗?
A: 原生不支持,但可以用翻译插件或先用ChatGPT翻译成英文。部分中文模型支持中文提示词。
Q: 生成的图可以商用吗?
A: Stable Diffusion本身允许商用,但具体模型有不同的许可证。大部分模型允许商用,下载时注意查看许可证。
基本信息
| 工具名称 | Stable Diffusion |
| 官网 | stability.ai |
| 开发商 | Stability AI |
| 发布 | 2022年 |
| 底层技术 | 扩散模型(开源) |
| 定价 | 完全免费(需自备显卡) |
| 核心能力 | AI图像生成/本地部署/模型训练/完全控制/数据私有 |
| 平台 | Windows / Mac / Linux(需NVIDIA显卡) |
