1. Stable Diffusion
Stable Diffusion 快速入门
装到自己电脑里,免费无限次生成AI图片——开源图像生成生态的事实标准。
这是什么?适合谁?
Stable Diffusion 是由 Stability AI 联合 CompVis、Runway 等团队在 2022 年发布的开源图像生成模型,代码与权重以 CreativeML Open RAIL-M 许可证公开,意味着任何人都可以免费下载、本地运行、二次分发甚至商用(需遵守许可证条款)。截至 2026 年初,它已经从最初的 SD 1.5 演进到 SD 3.5、SDXL 等多个版本,生态里又衍生出 ComfyUI、Automatic1111、InvokeAI 等数十种部署前端,以及 Civitai 上数以万计的社区模型(Checkpoint、LoRA、ControlNet 等),构成目前最庞大的开源 AI 图像生态。
它和 Midjourney、DALL-E 3 的最大区别在于”可控性”:你可以挑选任意基础模型,叠加 LoRA 控制特定画风,用 ControlNet 锁定人物姿势,甚至自己写脚本批量出图。对于完全不想折腾的纯小白,Stable Diffusion 不如 Midjourney、即梦那样”开箱即用”;但只要愿意花一个下午装环境,后续每次出图的边际成本几乎为零,而且没有内容审查、没有次数限制、没有水印。
适合谁:愿意折腾硬件与命令行的技术爱好者、需要批量出图或做特定风格训练的中小工作室、对数据隐私敏感不能把图片传给云端的企业用户、想从零理解扩散模型原理的学生。不适合只想”点一下就有图”的纯小白(建议先用即梦 AI、LiblibAI 跑通流程再考虑)。
准备工作
- 操作系统:Windows 10/11 64 位、macOS 12+、主流 Linux 发行版均可
- 显卡(强烈推荐):NVIDIA 显卡,显存 6GB 起(出 512×512 图够用),8GB+ 可出 1024×1024,12GB+ 跑 SDXL 流畅;Mac 可用 Apple Silicon 的 MPS 加速
- 硬盘:至少 20GB 可用空间(模型 + 依赖)
- Python:3.10 或 3.11 版本
- Git:用来克隆仓库
- 耐心:首次安装需要 30-90 分钟,包括下载约 5GB 的模型权重
3 步快速上手
第 1 步:安装 ComfyUI(推荐前端)
ComfyUI 是目前最流行的可视化节点式前端,工作流可以保存为 JSON 分享,适合从入门到生产全阶段。打开 PowerShell(Windows)或 Terminal(macOS/Linux),执行:
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt
国内访问 GitHub 慢的话,可以用 ghproxy 镜像:
git clone https://gh-proxy.com/https://github.com/comfyanonymous/ComfyUI.git
如果使用 NVIDIA 显卡但 PyTorch 默认装的是 CPU 版,需要单独重装:
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121
第 2 步:下载模型权重并放入目录
到 Hugging Face 的 Stability AI 仓库下载 SD 1.5 或 SDXL 基础模型(以官方为权威来源):
下载 .safetensors 格式的文件(不要下载 .ckpt,因为后者有 pickle 注入风险),放入:
ComfyUI/models/checkpoints/
启动 ComfyUI:
python main.py
浏览器会自动打开 http://127.0.0.1:8188,看到节点画布就说明服务跑起来了。
第 3 步:跑第一个文生图任务
在 ComfyUI 默认画布里,你已经能看到 “CLIP Text Encode (Positive)”、“KSampler”、“Empty Latent Image”、“VAE Decode”、“Save Image” 这几个节点。只需修改正向提示词节点的内容,例如:
masterpiece, best quality, 1girl, white dress, garden, sunlight,
soft focus, cinematic lighting
负向提示词节点写:
lowres, bad anatomy, bad hands, text, error, missing fingers
点右上角 “Queue Prompt”,等待 10-30 秒,生成的图片就会自动保存到 ComfyUI/output/ 目录,也直接在画布右侧预览。任务完成——你刚刚在本地、零成本生成了第一张 AI 画作。
常见踩坑
- 显存不足报错(OOM):出图时弹出 “CUDA out of memory”。把 KSampler 节点的 batch_size 改成 1,把 Empty Latent Image 的分辨率从 1024 降到 768 或 512,模型换成 SD 1.5 而不是 SDXL。
- 出图全是噪点或全黑:通常是 VAE 没匹配。SDXL 必须搭配专用 VAE 文件(从同一个 Hugging Face 仓库下载
sdxl_vae.safetensors,放到ComfyUI/models/vae/)并连接到 VAE Decode 节点。 - pip install 装到一半失败:网络问题。国内用户可以临时切换镜像:
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple -r requirements.txt。 - 启动后浏览器没自动打开:手动访问
http://127.0.0.1:8188;如果端口冲突,加--port 8189启动。 - 生成的图人脸崩、手指多一根:在负向提示词加
extra fingers, fewer fingers, extra digit, bad hands,并启用 ADetailer 插件做面部修复。 - Mac 出图极慢:确认在 ComfyUI 设置里把 device 选成
mps而不是cpu;Apple Silicon 跑 SDXL 也能用,但速度只有 N 卡 3060 的 1/3 左右。
初级用法
- 套用别人的工作流:在 ComfyUI 官网 comfy.org 的 Examples 板块,或 civitai.com 的 ComfyUI 频道,下载
.json工作流文件,直接拖进 ComfyUI 画布就能用。 - 加载社区 LoRA:LoRA(Low-Rank Adaptation)是几十 MB 的小模型,叠加在基础模型上就能学会特定画风/角色。例如想画宫崎骏风格,下载宫崎骏 LoRA 放到
ComfyUI/models/loras/,在 KSampler 前加一个 “Load LoRA” 节点即可。 - 文生图 + 放大:出 512×512 小图后,用 “Ultimate SD Upscale” 节点或外置工具(如 Real-ESRGAN)放大到 4K,既能保持细节又不会爆显存。
高级玩法
- ControlNet 控制姿势:下载 ControlNet 模型(如
control_v11p_sd15_openpose),上传一张人物照片,ComfyUI 会自动提取骨骼姿态,再叠文生图提示词,人物姿势和参考图完全一致。 - Inpainting 局部重绘:用 ComfyUI 的 “VAE Encode (for Inpainting)” 节点,对图片的某一块蒙版区域重绘,常见于”把头像里戴的眼镜擦掉”。
- 自己训练 LoRA:用 kohya_ss 训练脚本(项目地址 github.com/bmaltais/kohya_ss),准备 20-50 张同一主题的图片,跑 30 分钟到几小时,就能生成专属风格模型。
小技巧
- 模型不要乱下:Civitai 上的模型质量参差不齐,优先选下载量 > 1 万、评分 4.5+ 的;未知来源的
.ckpt可能有恶意代码,务必只下.safetensors。 - CFG Scale 调到 7-9 出图最稳:低于 5 图会”失神”,高于 12 图会过饱和、颜色失真。
- Sampler 选 DPM++ 2M Karras:综合速度与质量,是 ComfyUI 默认之外的”事实标准”。
- 关键词顺序有讲究:越靠前的关键词权重越高,主语放在第一行,质量词放最前(
masterpiece, best quality, ...)。 - 常用提示词模板:
masterpiece, best quality, absurdres, highres四个加在正向提示词开头能稳定提升画面质量。
常见问题 FAQ
Q1: Stable Diffusion 生成的图片版权归谁?能商用吗?
A: 取决于 Stable Diffusion 的具体条款和你的订阅方案。免费版本通常限制商用,付费版本通常授予完整商用权。具体以 https://stability.ai 的服务条款为准。商用前务必仔细阅读授权协议,避免侵权。
Q2: Stable Diffusion 生成的图片质量不好,如何改进?
A: 改进方法:1) prompt 更具体(主题/风格/光线/构图);2) 使用 negative prompt 排除不想要的元素;3) 提高生成步数(20-50 步常见);4) 调整 guidance scale(7-12 常见);5) 参考优秀 prompt 案例。多尝试,prompt 调优是经验活。
Q3: Stable Diffusion 的图片生成要多久?费用如何?
A: 取决于模型复杂度和服务器负载。简单图 5-20 秒,复杂图 30-60 秒。免费版本通常有每日生成数量限制,付费版本按次或按积分扣费。具体以官网定价为准。
Q4: Stable Diffusion 适合做什么?不适合做什么?
A: 适合:社交媒体配图、博客配图、设计灵感、营销素材、个人创作。不适合:高分辨率商业印刷(需专业软件)、精确文字渲染(AI 模型普遍弱)、人物肖像精确复刻(版权和伦理问题)。
Q5: 怎么用 Stable Diffusion 配合其他工具提升效率?
A: 建议组合:1) Stable Diffusion 生成初稿图片;2) Photoshop/GIMP 精修;3) Topaz Gigapixel 提升分辨率;4) Remove.bg 去背景;5) Canva 加文字排版。这样能弥补 AI 模型的不足。
参考链接
- 官方主页
- ComfyUI 项目
- Hugging Face 模型仓库
- 社区模型库
- ControlNet 文档
- 训练脚本 kohya_ss
- 入门视频教程(Bilibili 搜索 “ComfyUI 教程”)
更多学习资源
- Stability AI 官网 - 获取最新模型发布和技术博客
- ComfyUI GitHub - 最流行的节点式前端,工作流可视化
- Hugging Face 模型仓库 - 官方模型下载,含 SD 1.5/SDXL/SD 3.5
- Civitai 社区模型库 - 30万+社区模型(Checkpoint/LoRA/ControlNet)
- AUTOMATIC1111 WebUI - 另一主流前端,界面更传统
本文基于官方文档和公开资料整理,AI辅助生成,MagicNetWorld 尚未完成独立实测。如有错误或过时信息,请通过 contact@magicnetworld.com 反馈。
2. Stable Diffusion 多维度简评
Stable Diffusion 多维度简评
本文基于公开资料整理,对 Stable Diffusion 进行多维度分析
深度竞品对比
核心竞品对照表
| 维度 | Stable Diffusion 3.5 | Midjourney V7 | Flux Pro 1.1 | DALL-E / OpenAI Images |
|---|---|---|---|---|
| 核心优势 | 开放权重、本地部署、可训练 LoRA、ControlNet 生态强 | 艺术审美强,上手快,默认出片率高 | 角色一致性强,专业商业级 | 与 ChatGPT / API 生态结合好,自然语言理解强,文字渲染强 |
| 艺术质量 | 8.5 | 9.5 | 9.0 | 8.5 |
| 角色一致性 | 9.0 | 8.0 | 9.5 | 7.0 |
| 文字渲染 | 7.5 | 7.0 | 8.5 | 9.5 |
| 开源 | ✅ | ❌ | 部分 | ❌ |
| 商用 | ✅(Community许可条件) | ✅(Pro+) | ✅(Pro) | ✅ |
| 本地部署 | ✅ | ❌ | ❌ | ❌ |
| 成本结构 | 免费(本地)/ $0.5–2/时(云) | $30–120/月 | $0.05/张 | 含在 ChatGPT 订阅内 |
| 学习门槛 | 中高(2–4 周达熟练) | 低 | 低 | 低 |
TCO 对比(长期估算)
| 方案 | 年成本 | 说明 |
|---|---|---|
| Midjourney Pro | $720/年 | $60/月 × 12 |
| ComfyUI + SD 本地 | $2,000/3–5年 | 一次性硬件投入 |
| 云端 GPU | $0.5–2/小时 | RunPod/Vast.ai |
长期看,本地部署 SD 比 Midjourney 订阅便宜 60–80%。
适用场景建议
- 本地部署 / 隐私 / 商业项目 → Stable Diffusion 3.5
- 艺术 / 品牌 → Midjourney Pro
- 角色一致性 / 专业商业 → Flux Pro
- 通用 / 文字渲染 → ChatGPT + DALL-E
用户反馈
核心优势
- ✅ 开放性:完全开源权重,支持本地部署,数据不出本机
- ✅ 可定制性:LoRA 定制风格/角色,ControlNet 精确控制构图
- ✅ 成本优势:长期使用成本远低于订阅制竞品
- ✅ 生态丰富:Civitai 200万+模型,AUTOMATIC1111/ComfyUI/Forge 等多个 UI
- ✅ Flux 集成:ComfyUI 支持 SD + Flux 混用,适合商业项目批量生产
已知硬伤
- ⚠️ 学习曲线较高:新手需 2–4 周才能熟练
- ⚠️ 硬件要求较高:推荐 16GB 显存
- ⚠️ 文字渲染较弱:比 DALL-E 弱约 30%
- ⚠️ 部分 LoRA 训练涉及版权争议:需谨慎确认授权来源
- ⚠️ 默认美学未必超过 Midjourney:需调参和模型搭配
Stability AI 2024-10 危机说明
2024 年 10 月,Stability AI 经历核心团队动荡,创始人 Emad Mostaque 辞职。公司随后转型为社区驱动的项目模式,SD 3.5 仍在持续更新。这是开源 AI 项目韧性的一个例证——SD 仍然是”开源 + 本地部署”AI 绘画的事实标准。在 Midjourney 闭源、DALL-E 闭源、Flux 部分开源的格局下,SD 是唯一完全开源且可商用的选项。
总结与建议
Stable Diffusion 是 2026 年”专业创作者 + 商业项目”的优质选择之一。其”本地部署 + 完全开源 + 商用”的组合在 AI 图像生成领域仍是独一份。对于追求自由定制、隐私保护和成本可控的用户,SD 是最具性价比的方案;对于追求即开即用和最高默认美学的用户,Midjourney 或云端产品可能更合适。
最佳实践
采用多工具组合策略:
- 用 ComfyUI + SD 做批量生产和定制化项目
- 用 Midjourney 做前期创意探索和高质量艺术输出
- 用 DALL-E / ChatGPT 做自然语言协作
本文基于公开资料整理。
报告生成时间:2026-06-17 · 作者:MagicNetWorld
📊 评分与标签
评分说明
总分 9.0/10 · P_优选
📊 可观测社区指标(数据核验日期:2026-07-07)
- GitHub: Comfy-Org/ComfyUI ★120k, 🔱14k;AUTOMATIC1111/stable-diffusion-webui ★164k, 🔱30.4k
- Reddit: r/StableDiffusion 100万+成员;r/comfyui 10万+成员
- CivitAI: civitai.com 社区模型超过30万个(Checkpoint/LoRA/ControlNet)
- HuggingFace: stabilityai 组织下模型总下载量超5000万次
⚙️ 功能完整度 2.0/2.5
- SD 3.5提供3种模型规格(Large 8B/Medium 2.5B/Turbo),SDXL 1.0生态成熟,搭配ComfyUI/A1111前端实现文生图、图生图、ControlNet精确控制(OpenPose/Canny/Depth等15+种控制器)、LoRA/Textual Inversion微调、Inpaint/Outpaint局部重绘、IP-Adapter风格迁移、Ultimate SD Upscale超分辨率放大
- 对比Midjourney: 功能深度和可控性遥遥领先(ControlNet精确姿势 vs MJ仅角色参考),但开箱即用体验不如MJ
- 对比DALL·E 3: 风格多样性完胜(社区LoRA可实现任何画风),自然语言理解不如DALL·E
- 扣分因: 生态碎片化(ComfyUI/A1111/InvokeAI/Forge等多个前端学习成本高),A1111最后提交距今已2年(项目维护停滞),中文模型和prompt支持弱于即梦AI
✨ 输出质量 2.3/2.5
- SD 3.5 Large在光线物理和材质质感上大幅提升,写实风格已接近商业摄影标准;配合社区高端Checkpoint(如Realistic Vision/Juggernaut)和LoRA叠加,输出质量可媲美Midjourney V7
- 对比Midjourney V8: 基础模型在审美构图和氛围营造上仍有约10-15%差距,但定制化产出(特定角色/风格/姿势)的灵活性完胜
- 对比DALL·E 3: prompt理解准确度不如(需精心编写提示词),但风格上限更高
- Artificial Analysis Image Arena盲测中SD 3.5+社区模型的Elo分与Midjourney差距缩小至5%以内
- 扣分因: 裸模型输出质量不稳定,依赖用户对Checkpoint/LoRA/采样器的组合选择经验;人物手指和面部细节在复杂姿势下仍有约15%的失真率
🖐️ 易用性 1.4/1.5
- WebUI(AUTOMATIC1111)一键安装包(Stability Matrix)降低入门门槛,ComfyUI节点式工作流可视化程度高;社区教程丰富(B站/YouTube/CivitAI),2小时可完成从安装到出图全流程
- 对比Midjourney: 需本地GPU(6GB+ VRAM)和Python环境配置,对非技术用户存在1-2小时的安装门槛,不如MJ浏览器即用便捷
- 对比DALL·E 3: 学习曲线更陡(需理解Checkpoint/LoRA/ControlNet概念),但控制和自由度远超
- 扣分因: Python依赖冲突、CUDA版本不匹配、插件兼容性等问题仍是新手常见绊脚石,macOS Apple Silicon用户性能仅为NVIDIA显卡的1/3
💰 性价比 1.4/1.5
- 完全开源免费(RAIL-M许可证),本地运行仅需消费级GPU(建议8GB+ VRAM,如RTX 3060约2000元)
- 对比Midjourney Basic $10/月: 一次性硬件投入后零边际成本,年省$120-720
- 对比DALL·E 3(ChatGPT Plus $20/月): 对批量出图用户成本优势巨大
- 对比Leonardo AI($12/月含云端GPU): SD本地部署对无硬件用户不具备成本优势
- 扣分因: 需要独立显卡(集成显卡或Mac虽可运行但极慢),对无GPU用户需额外投入约2000元硬件成本;大模型下载(5-10GB/个)对网络和存储有一定要求
🔒 稳定性 0.9/1.0
- 开源项目依赖活跃社区维护,ComfyUI保持每周更新(最新提交20分钟前);A1111最后提交距今2年,维护已停滞,社区转向Forge等分支
- Python依赖冲突和插件版本兼容性问题常见但社区响应快(GitHub Issues通常在24h内有人回复)
- 对比Midjourney云端服务: 无服务中断风险(本地运行不受云端影响),但技术维护成本由用户承担
- 扣分因: 版本升级可能导致旧工作流不兼容(SD 1.5→SDXL→SD 3.5需重新适配参数),A1111前端维护停滞增加维护复杂度
🛡️ 隐私安全 1.0/1.0
- 完全本地运行,所有推理在本地GPU完成,无需网络连接(模型下载后);数据100%不出本机,无内容审核,无水印,无遥测
- 来源:Stability AI官网 + 开源协议(RAIL-M)
- 对比Midjourney/DALL·E: 所有提示词和图片需上传云端,隐私保护级别差距巨大
- 对比Adobe Firefly: 商业版权同样清晰,但SD不依赖第三方授权训练数据
- Stable Diffusion是当前AI图像生成领域隐私安全的最佳实践,适合涉密/商业机密/IP敏感场景
评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。各维度得分求和为:2.0 + 2.3 + 1.4 + 1.4 + 0.9 + 1.0 = 9.0,与总分一致。
🏷️ 标签说明
- 开源免费: 完全开源(RAIL-M许可证),可本地免费部署使用,社区模型30万+免费获取。来源:Stability AI
- 图像生成: 全球最大开源AI图像生成生态,SD 3.5+社区模型30万+,功能深度行业第一。来源:CivitAI
- 本地: 支持本地安装运行,数据100%存储在本地,无需网络连接,隐私安全最佳实践。来源:ComfyUI GitHub
📋 来源与核验记录
- ✅ 已核验: ComfyUI GitHub(页面存在,120k Stars, 14k Forks, 最新提交20分钟前)
- ✅ 已核验: A1111 GitHub(页面存在,164k Stars, 30.4k Forks, 最后提交2年前)
- ✅ 已核验: Stability AI官网(页面存在,确认SD产品线和RAIL-M许可信息)
- ⚠️ 未验证: r/StableDiffusion(Reddit JS challenge拦截,成员数引用自公开数据)
- ⚠️ 间接来源: CivitAI社区模型30万+、HuggingFace下载量5000万+(引用自公开数据,未实时抓取)
- ⚠️ 间接来源: Artificial Analysis Image Arena盲测Elo分(引用自第三方排行榜,未直接抓取)
- ❌ 死链: 无
同分类推荐
AI图像生成 分类下的其他工具