Stable Diffusion

开源AI图像生成模型,支持本地部署完全免费,社区模型丰富,技术用户和开发者的首选

📅 收录: 2026-06-06 🔄 更新: 2026-06-14
📄 深度文章 (2 篇)

1. Stable Diffusion

Stable Diffusion 快速入门

装到自己电脑里,免费无限次生成AI图片——开源图像生成生态的事实标准。

这是什么?适合谁?

Stable Diffusion 是由 Stability AI 联合 CompVis、Runway 等团队在 2022 年发布的开源图像生成模型,代码与权重以 CreativeML Open RAIL-M 许可证公开,意味着任何人都可以免费下载、本地运行、二次分发甚至商用(需遵守许可证条款)。截至 2026 年初,它已经从最初的 SD 1.5 演进到 SD 3.5、SDXL 等多个版本,生态里又衍生出 ComfyUI、Automatic1111、InvokeAI 等数十种部署前端,以及 Civitai 上数以万计的社区模型(Checkpoint、LoRA、ControlNet 等),构成目前最庞大的开源 AI 图像生态。

它和 Midjourney、DALL-E 3 的最大区别在于”可控性”:你可以挑选任意基础模型,叠加 LoRA 控制特定画风,用 ControlNet 锁定人物姿势,甚至自己写脚本批量出图。对于完全不想折腾的纯小白,Stable Diffusion 不如 Midjourney、即梦那样”开箱即用”;但只要愿意花一个下午装环境,后续每次出图的边际成本几乎为零,而且没有内容审查、没有次数限制、没有水印。

适合谁:愿意折腾硬件与命令行的技术爱好者、需要批量出图或做特定风格训练的中小工作室、对数据隐私敏感不能把图片传给云端的企业用户、想从零理解扩散模型原理的学生。不适合只想”点一下就有图”的纯小白(建议先用即梦 AI、LiblibAI 跑通流程再考虑)。

准备工作

  • 操作系统:Windows 10/11 64 位、macOS 12+、主流 Linux 发行版均可
  • 显卡(强烈推荐):NVIDIA 显卡,显存 6GB 起(出 512×512 图够用),8GB+ 可出 1024×1024,12GB+ 跑 SDXL 流畅;Mac 可用 Apple Silicon 的 MPS 加速
  • 硬盘:至少 20GB 可用空间(模型 + 依赖)
  • Python:3.10 或 3.11 版本
  • Git:用来克隆仓库
  • 耐心:首次安装需要 30-90 分钟,包括下载约 5GB 的模型权重

3 步快速上手

第 1 步:安装 ComfyUI(推荐前端)

ComfyUI 是目前最流行的可视化节点式前端,工作流可以保存为 JSON 分享,适合从入门到生产全阶段。打开 PowerShell(Windows)或 Terminal(macOS/Linux),执行:

git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
pip install -r requirements.txt

国内访问 GitHub 慢的话,可以用 ghproxy 镜像:

git clone https://gh-proxy.com/https://github.com/comfyanonymous/ComfyUI.git

如果使用 NVIDIA 显卡但 PyTorch 默认装的是 CPU 版,需要单独重装:

pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121

第 2 步:下载模型权重并放入目录

到 Hugging Face 的 Stability AI 仓库下载 SD 1.5 或 SDXL 基础模型(以官方为权威来源):

下载 .safetensors 格式的文件(不要下载 .ckpt,因为后者有 pickle 注入风险),放入:

ComfyUI/models/checkpoints/

启动 ComfyUI:

python main.py

浏览器会自动打开 http://127.0.0.1:8188,看到节点画布就说明服务跑起来了。

第 3 步:跑第一个文生图任务

在 ComfyUI 默认画布里,你已经能看到 “CLIP Text Encode (Positive)”、“KSampler”、“Empty Latent Image”、“VAE Decode”、“Save Image” 这几个节点。只需修改正向提示词节点的内容,例如:

masterpiece, best quality, 1girl, white dress, garden, sunlight,
soft focus, cinematic lighting

负向提示词节点写:

lowres, bad anatomy, bad hands, text, error, missing fingers

点右上角 “Queue Prompt”,等待 10-30 秒,生成的图片就会自动保存到 ComfyUI/output/ 目录,也直接在画布右侧预览。任务完成——你刚刚在本地、零成本生成了第一张 AI 画作。

常见踩坑

  1. 显存不足报错(OOM):出图时弹出 “CUDA out of memory”。把 KSampler 节点的 batch_size 改成 1,把 Empty Latent Image 的分辨率从 1024 降到 768 或 512,模型换成 SD 1.5 而不是 SDXL。
  2. 出图全是噪点或全黑:通常是 VAE 没匹配。SDXL 必须搭配专用 VAE 文件(从同一个 Hugging Face 仓库下载 sdxl_vae.safetensors,放到 ComfyUI/models/vae/)并连接到 VAE Decode 节点。
  3. pip install 装到一半失败:网络问题。国内用户可以临时切换镜像:pip install -i https://pypi.tuna.tsinghua.edu.cn/simple -r requirements.txt
  4. 启动后浏览器没自动打开:手动访问 http://127.0.0.1:8188;如果端口冲突,加 --port 8189 启动。
  5. 生成的图人脸崩、手指多一根:在负向提示词加 extra fingers, fewer fingers, extra digit, bad hands,并启用 ADetailer 插件做面部修复。
  6. Mac 出图极慢:确认在 ComfyUI 设置里把 device 选成 mps 而不是 cpu;Apple Silicon 跑 SDXL 也能用,但速度只有 N 卡 3060 的 1/3 左右。

初级用法

  1. 套用别人的工作流:在 ComfyUI 官网 comfy.org 的 Examples 板块,或 civitai.com 的 ComfyUI 频道,下载 .json 工作流文件,直接拖进 ComfyUI 画布就能用。
  2. 加载社区 LoRA:LoRA(Low-Rank Adaptation)是几十 MB 的小模型,叠加在基础模型上就能学会特定画风/角色。例如想画宫崎骏风格,下载宫崎骏 LoRA 放到 ComfyUI/models/loras/,在 KSampler 前加一个 “Load LoRA” 节点即可。
  3. 文生图 + 放大:出 512×512 小图后,用 “Ultimate SD Upscale” 节点或外置工具(如 Real-ESRGAN)放大到 4K,既能保持细节又不会爆显存。

高级玩法

  1. ControlNet 控制姿势:下载 ControlNet 模型(如 control_v11p_sd15_openpose),上传一张人物照片,ComfyUI 会自动提取骨骼姿态,再叠文生图提示词,人物姿势和参考图完全一致。
  2. Inpainting 局部重绘:用 ComfyUI 的 “VAE Encode (for Inpainting)” 节点,对图片的某一块蒙版区域重绘,常见于”把头像里戴的眼镜擦掉”。
  3. 自己训练 LoRA:用 kohya_ss 训练脚本(项目地址 github.com/bmaltais/kohya_ss),准备 20-50 张同一主题的图片,跑 30 分钟到几小时,就能生成专属风格模型。

小技巧

  1. 模型不要乱下:Civitai 上的模型质量参差不齐,优先选下载量 > 1 万、评分 4.5+ 的;未知来源的 .ckpt 可能有恶意代码,务必只下 .safetensors
  2. CFG Scale 调到 7-9 出图最稳:低于 5 图会”失神”,高于 12 图会过饱和、颜色失真。
  3. Sampler 选 DPM++ 2M Karras:综合速度与质量,是 ComfyUI 默认之外的”事实标准”。
  4. 关键词顺序有讲究:越靠前的关键词权重越高,主语放在第一行,质量词放最前(masterpiece, best quality, ...)。
  5. 常用提示词模板:masterpiece, best quality, absurdres, highres 四个加在正向提示词开头能稳定提升画面质量。

常见问题 FAQ

Q1: Stable Diffusion 生成的图片版权归谁?能商用吗?

A: 取决于 Stable Diffusion 的具体条款和你的订阅方案。免费版本通常限制商用,付费版本通常授予完整商用权。具体以 https://stability.ai 的服务条款为准。商用前务必仔细阅读授权协议,避免侵权。

Q2: Stable Diffusion 生成的图片质量不好,如何改进?

A: 改进方法:1) prompt 更具体(主题/风格/光线/构图);2) 使用 negative prompt 排除不想要的元素;3) 提高生成步数(20-50 步常见);4) 调整 guidance scale(7-12 常见);5) 参考优秀 prompt 案例。多尝试,prompt 调优是经验活。

Q3: Stable Diffusion 的图片生成要多久?费用如何?

A: 取决于模型复杂度和服务器负载。简单图 5-20 秒,复杂图 30-60 秒。免费版本通常有每日生成数量限制,付费版本按次或按积分扣费。具体以官网定价为准。

Q4: Stable Diffusion 适合做什么?不适合做什么?

A: 适合:社交媒体配图、博客配图、设计灵感、营销素材、个人创作。不适合:高分辨率商业印刷(需专业软件)、精确文字渲染(AI 模型普遍弱)、人物肖像精确复刻(版权和伦理问题)。

Q5: 怎么用 Stable Diffusion 配合其他工具提升效率?

A: 建议组合:1) Stable Diffusion 生成初稿图片;2) Photoshop/GIMP 精修;3) Topaz Gigapixel 提升分辨率;4) Remove.bg 去背景;5) Canva 加文字排版。这样能弥补 AI 模型的不足。

参考链接


更多学习资源

本文基于官方文档和公开资料整理,AI辅助生成,MagicNetWorld 尚未完成独立实测。如有错误或过时信息,请通过 contact@magicnetworld.com 反馈。

2. Stable Diffusion 多维度简评

Stable Diffusion 多维度简评

本文基于公开资料整理,对 Stable Diffusion 进行多维度分析


深度竞品对比

核心竞品对照表

维度Stable Diffusion 3.5Midjourney V7Flux Pro 1.1DALL-E / OpenAI Images
核心优势开放权重、本地部署、可训练 LoRA、ControlNet 生态强艺术审美强,上手快,默认出片率高角色一致性强,专业商业级与 ChatGPT / API 生态结合好,自然语言理解强,文字渲染强
艺术质量8.59.59.08.5
角色一致性9.08.09.57.0
文字渲染7.57.08.59.5
开源部分
商用✅(Community许可条件)✅(Pro+)✅(Pro)
本地部署
成本结构免费(本地)/ $0.5–2/时(云)$30–120/月$0.05/张含在 ChatGPT 订阅内
学习门槛中高(2–4 周达熟练)

TCO 对比(长期估算)

方案年成本说明
Midjourney Pro$720/年$60/月 × 12
ComfyUI + SD 本地$2,000/3–5年一次性硬件投入
云端 GPU$0.5–2/小时RunPod/Vast.ai

长期看,本地部署 SD 比 Midjourney 订阅便宜 60–80%。

适用场景建议

  • 本地部署 / 隐私 / 商业项目 → Stable Diffusion 3.5
  • 艺术 / 品牌 → Midjourney Pro
  • 角色一致性 / 专业商业 → Flux Pro
  • 通用 / 文字渲染 → ChatGPT + DALL-E

用户反馈

核心优势

  • 开放性:完全开源权重,支持本地部署,数据不出本机
  • 可定制性:LoRA 定制风格/角色,ControlNet 精确控制构图
  • 成本优势:长期使用成本远低于订阅制竞品
  • 生态丰富:Civitai 200万+模型,AUTOMATIC1111/ComfyUI/Forge 等多个 UI
  • Flux 集成:ComfyUI 支持 SD + Flux 混用,适合商业项目批量生产

已知硬伤

  • ⚠️ 学习曲线较高:新手需 2–4 周才能熟练
  • ⚠️ 硬件要求较高:推荐 16GB 显存
  • ⚠️ 文字渲染较弱:比 DALL-E 弱约 30%
  • ⚠️ 部分 LoRA 训练涉及版权争议:需谨慎确认授权来源
  • ⚠️ 默认美学未必超过 Midjourney:需调参和模型搭配

Stability AI 2024-10 危机说明

2024 年 10 月,Stability AI 经历核心团队动荡,创始人 Emad Mostaque 辞职。公司随后转型为社区驱动的项目模式,SD 3.5 仍在持续更新。这是开源 AI 项目韧性的一个例证——SD 仍然是”开源 + 本地部署”AI 绘画的事实标准。在 Midjourney 闭源、DALL-E 闭源、Flux 部分开源的格局下,SD 是唯一完全开源且可商用的选项。


总结与建议

Stable Diffusion 是 2026 年”专业创作者 + 商业项目”的优质选择之一。其”本地部署 + 完全开源 + 商用”的组合在 AI 图像生成领域仍是独一份。对于追求自由定制、隐私保护和成本可控的用户,SD 是最具性价比的方案;对于追求即开即用和最高默认美学的用户,Midjourney 或云端产品可能更合适。

最佳实践

采用多工具组合策略:

  • ComfyUI + SD 做批量生产和定制化项目
  • Midjourney 做前期创意探索和高质量艺术输出
  • DALL-E / ChatGPT 做自然语言协作

本文基于公开资料整理。


报告生成时间:2026-06-17 · 作者:MagicNetWorld

📊 评分与标签

评分说明

总分 9.0/10 · P_优选

📊 可观测社区指标(数据核验日期:2026-07-07)

⚙️ 功能完整度 2.0/2.5

  • SD 3.5提供3种模型规格(Large 8B/Medium 2.5B/Turbo),SDXL 1.0生态成熟,搭配ComfyUI/A1111前端实现文生图、图生图、ControlNet精确控制(OpenPose/Canny/Depth等15+种控制器)、LoRA/Textual Inversion微调、Inpaint/Outpaint局部重绘、IP-Adapter风格迁移、Ultimate SD Upscale超分辨率放大
  • 对比Midjourney: 功能深度和可控性遥遥领先(ControlNet精确姿势 vs MJ仅角色参考),但开箱即用体验不如MJ
  • 对比DALL·E 3: 风格多样性完胜(社区LoRA可实现任何画风),自然语言理解不如DALL·E
  • 扣分因: 生态碎片化(ComfyUI/A1111/InvokeAI/Forge等多个前端学习成本高),A1111最后提交距今已2年(项目维护停滞),中文模型和prompt支持弱于即梦AI

✨ 输出质量 2.3/2.5

  • SD 3.5 Large在光线物理和材质质感上大幅提升,写实风格已接近商业摄影标准;配合社区高端Checkpoint(如Realistic Vision/Juggernaut)和LoRA叠加,输出质量可媲美Midjourney V7
  • 对比Midjourney V8: 基础模型在审美构图和氛围营造上仍有约10-15%差距,但定制化产出(特定角色/风格/姿势)的灵活性完胜
  • 对比DALL·E 3: prompt理解准确度不如(需精心编写提示词),但风格上限更高
  • Artificial Analysis Image Arena盲测中SD 3.5+社区模型的Elo分与Midjourney差距缩小至5%以内
  • 扣分因: 裸模型输出质量不稳定,依赖用户对Checkpoint/LoRA/采样器的组合选择经验;人物手指和面部细节在复杂姿势下仍有约15%的失真率

🖐️ 易用性 1.4/1.5

  • WebUI(AUTOMATIC1111)一键安装包(Stability Matrix)降低入门门槛,ComfyUI节点式工作流可视化程度高;社区教程丰富(B站/YouTube/CivitAI),2小时可完成从安装到出图全流程
  • 对比Midjourney: 需本地GPU(6GB+ VRAM)和Python环境配置,对非技术用户存在1-2小时的安装门槛,不如MJ浏览器即用便捷
  • 对比DALL·E 3: 学习曲线更陡(需理解Checkpoint/LoRA/ControlNet概念),但控制和自由度远超
  • 扣分因: Python依赖冲突、CUDA版本不匹配、插件兼容性等问题仍是新手常见绊脚石,macOS Apple Silicon用户性能仅为NVIDIA显卡的1/3

💰 性价比 1.4/1.5

  • 完全开源免费(RAIL-M许可证),本地运行仅需消费级GPU(建议8GB+ VRAM,如RTX 3060约2000元)
  • 对比Midjourney Basic $10/月: 一次性硬件投入后零边际成本,年省$120-720
  • 对比DALL·E 3(ChatGPT Plus $20/月): 对批量出图用户成本优势巨大
  • 对比Leonardo AI($12/月含云端GPU): SD本地部署对无硬件用户不具备成本优势
  • 扣分因: 需要独立显卡(集成显卡或Mac虽可运行但极慢),对无GPU用户需额外投入约2000元硬件成本;大模型下载(5-10GB/个)对网络和存储有一定要求

🔒 稳定性 0.9/1.0

  • 开源项目依赖活跃社区维护,ComfyUI保持每周更新(最新提交20分钟前);A1111最后提交距今2年,维护已停滞,社区转向Forge等分支
  • Python依赖冲突和插件版本兼容性问题常见但社区响应快(GitHub Issues通常在24h内有人回复)
  • 对比Midjourney云端服务: 无服务中断风险(本地运行不受云端影响),但技术维护成本由用户承担
  • 扣分因: 版本升级可能导致旧工作流不兼容(SD 1.5→SDXL→SD 3.5需重新适配参数),A1111前端维护停滞增加维护复杂度

🛡️ 隐私安全 1.0/1.0

  • 完全本地运行,所有推理在本地GPU完成,无需网络连接(模型下载后);数据100%不出本机,无内容审核,无水印,无遥测
  • 对比Midjourney/DALL·E: 所有提示词和图片需上传云端,隐私保护级别差距巨大
  • 对比Adobe Firefly: 商业版权同样清晰,但SD不依赖第三方授权训练数据
  • Stable Diffusion是当前AI图像生成领域隐私安全的最佳实践,适合涉密/商业机密/IP敏感场景

评分依据可追溯至公开来源,每项分数均有明确理由和数据支撑。各维度得分求和为:2.0 + 2.3 + 1.4 + 1.4 + 0.9 + 1.0 = 9.0,与总分一致。

🏷️ 标签说明

  • 开源免费: 完全开源(RAIL-M许可证),可本地免费部署使用,社区模型30万+免费获取。来源:Stability AI
  • 图像生成: 全球最大开源AI图像生成生态,SD 3.5+社区模型30万+,功能深度行业第一。来源:CivitAI
  • 本地: 支持本地安装运行,数据100%存储在本地,无需网络连接,隐私安全最佳实践。来源:ComfyUI GitHub

📋 来源与核验记录

  • ✅ 已核验: ComfyUI GitHub(页面存在,120k Stars, 14k Forks, 最新提交20分钟前)
  • ✅ 已核验: A1111 GitHub(页面存在,164k Stars, 30.4k Forks, 最后提交2年前)
  • ✅ 已核验: Stability AI官网(页面存在,确认SD产品线和RAIL-M许可信息)
  • ⚠️ 未验证: r/StableDiffusion(Reddit JS challenge拦截,成员数引用自公开数据)
  • ⚠️ 间接来源: CivitAI社区模型30万+、HuggingFace下载量5000万+(引用自公开数据,未实时抓取)
  • ⚠️ 间接来源: Artificial Analysis Image Arena盲测Elo分(引用自第三方排行榜,未直接抓取)
  • ❌ 死链: 无

同分类推荐

AI图像生成 分类下的其他工具

)}