Stable Diffusion部署与出图全攻略:从整合包到提示词调优
发布时间:2026/9/26 6:26:29来源:尧图网络
1. 为什么我劝你先搞清楚 Stable Diffusion 到底在干什么1.1 从“输入一句话吐出一张图”说起很多人第一次接触 Stable Diffusion脑子里想的都是“我装完就能画图了”。但实际动手之后才发现光是把环境跑起来就能卡住一大半人。我在过去两年里帮朋友装过不下二十次从最早的纯命令行到后来的 WebUI再到现在的各种整合包踩过的坑基本能写一本小册子。先把最核心的事情说清楚Stable Diffusion 本质上是一个扩散模型。你可以把它想象成一块被泼满墨汁的画布模型做的事情是“反向擦除”——从一团完全随机的噪点开始一步一步地去噪最终还原出一张符合你文字描述的图像。这个过程叫采样每一步去噪都依赖一个训练好的神经网络来预测“当前这团噪点里哪些部分应该被去掉”。那文字是怎么影响画面的靠的是CLIP 文本编码器。你输入的提示词会被编码成一串向量这串向量在每一步去噪时都会参与计算相当于不断告诉模型“往这个方向擦”。所以提示词写得越具体模型擦出来的方向就越准。这里面有个关键参数叫采样步数Steps。步数太少噪点没擦干净画面糊步数太多收益递减还浪费时间。一般 20 到 30 步是甜点区超过 40 步基本看不出区别。另一个参数是CFG Scale它控制模型“听你话”的程度。太低比如 3 以下画面自由发挥太高比如 15 以上画面会变得僵硬、色彩过饱和。7 到 12 是比较舒服的区间。1.2 为什么大家都在用 WebUI而不是原版脚本Stable Diffusion 最早开源出来的时候只有一堆 Python 脚本跑图得敲命令行改个参数要翻代码。后来 AUTOMATIC1111 做了一个WebUI把所有参数都搬到了浏览器界面上点点鼠标就能调这才真正把门槛降下来。WebUI 的核心价值在于三点参数可视化、插件生态、批量处理。你可以实时看到每一步的去噪预览可以装 ControlNet 控制姿势可以用 LoRA 叠加风格还能一次性跑几十张图做筛选。这些功能如果全靠命令行效率会低到让人放弃。再往后又出现了Forge这个分支。Forge 本质上是 WebUI 的重构版优化了显存占用和出图速度尤其是在低显存显卡上表现更明显。它的界面和 WebUI 几乎一样但底层做了大量性能改进。现在很多人说的“WebUI Forge 整合包”其实就是把 Forge 版本打包好省去自己配环境的麻烦。至于ComfyUI那是另一条路线——节点式工作流。它把生成过程拆成一个个节点你可以像搭积木一样自由组合。灵活度极高但学习曲线也陡。新手我一般建议先从 WebUI 或 Forge 入手等熟悉了再去碰 ComfyUI。1.3 整合包到底整合了什么所谓“整合包”说白了就是把 Python 运行时、依赖库、模型文件、启动脚本全部打包在一起解压就能用。秋叶整合包是国内做得最成熟的一批它的核心贡献是解决了三个痛点Python 环境隔离不用你系统里装什么版本它自带一个干净的运行时。依赖预编译像 xformers、torch 这些库在不同显卡上编译很麻烦整合包里已经配好了。启动脚本封装双击一个 bat 文件就能启动自动检测显卡、自动设置参数。但整合包也不是万能的。它体积大动辄十几个 G更新慢而且有时候你遇到问题去搜发现别人的报错和你不一样因为环境细节有差异。所以我的建议是先用整合包跑通再逐步理解背后的东西。2. 部署之前先把这几件事想明白2.1 你的硬件到底能不能跑这是最现实的问题。Stable Diffusion 对显卡的要求主要集中在显存上。我整理了一个粗略的对照表你可以直接对号入座显存容量能做什么体验评价4GB512x512 基础出图勉强跑能跑但慢容易爆显存6GB512x512 流畅768 勉强入门可用需开低显存模式8GB768x768 流畅1024 可跑主流甜点大部分模型够用12GB1024x1024 流畅可跑 ControlNet舒服批量出图无压力16GB高分辨率、多模型切换基本不用操心显存N 卡NVIDIA用户是最省心的因为 CUDA 生态成熟xformers 加速也支持得好。A 卡AMD用户走 DirectML 路线也能跑但速度和兼容性会打折扣。至于纯 CPU 跑图我只能说能跑但一张图等几分钟体验很差不推荐。注意显存不是唯一指标。显卡的算力CUDA 核心数决定了出图速度。同样是 8GB 显存3060Ti 比 2060 快将近一倍。2.2 硬盘空间要留够很多人只盯着显卡忽略了硬盘。一个完整的部署包含以下几块整合包本体约 5-8GB基础模型Checkpoint每个 2-7GB通常你会下载好几个LoRA 模型每个 50-200MB容易越攒越多ControlNet 模型每个 1-2GB常用的大概 5-8 个VAE 和插件零碎加起来也有几个 G我自己的模型文件夹现在已经超过 200GB 了。所以建议你至少预留100GB 以上的空闲空间而且最好是固态硬盘因为加载模型的速度差距非常明显。2.3 网络环境与下载源的选择模型文件动辄几个 G下载速度直接决定你的部署体验。国内访问一些海外模型站速度不稳定所以很多人会选择国内镜像源。这里我不具体推荐某个站点但你可以遵循一个原则优先选国内可直连的镜像其次选支持断点续传的工具。下载工具方面浏览器直接下载大文件容易断建议用支持多线程和断点续传的下载器。另外很多整合包会附带一个“模型下载器”脚本内部已经配好了镜像源直接用那个往往比手动下载省事。3. 手把手部署从解压到出第一张图3.1 整合包的正确解压姿势拿到整合包之后第一件事是解压到纯英文路径。我见过太多人解压到“D:\我的文件\AI画图\”这种路径下然后启动报错找了半天才发现是中文路径的问题。正确的做法是这样D:\SD\webui\ - 整合包根目录 D:\SD\models\ - 模型存放目录可以单独放 D:\SD\outputs\ - 出图输出目录路径里不要有空格、中文、特殊符号。解压工具推荐用 7-Zip 或 BandizipWindows 自带的解压有时候会丢文件。解压完成后你会看到几个关键的 bat 文件run.bat或webui-user.bat主启动脚本update.bat更新脚本launch.bat某些整合包的快捷启动3.2 启动脚本里那几个参数到底改不改打开webui-user.bat你会看到类似这样的内容set COMMANDLINE_ARGS这个COMMANDLINE_ARGS就是启动参数决定了 WebUI 怎么跑。几个常用的参数我列一下参数作用什么时候用--xformers启用 xformers 加速N 卡用户能提速 20-30%--medvram中等显存优化6-8GB 显存--lowvram低显存优化4-6GB 显存--api开启 API 接口需要外部调用时--listen允许局域网访问手机或别的电脑访问--port 7861指定端口默认端口被占用时我的建议是先不加任何参数启动一次看看能不能跑通。如果能跑通但速度慢再加--xformers。如果爆显存再加--medvram或--lowvram。不要一上来就堆一堆参数出了问题不好排查。实操心得--xformers不是万能的。某些显卡型号上开启后反而会报错这时候去掉这个参数改用--opt-sdp-attention也能起到类似效果。3.3 首次启动会经历什么双击run.bat之后会弹出一个命令行窗口。第一次启动会做几件事检查 Python 环境整合包自带的 Python 会被激活安装依赖如果整合包没预装全这一步会联网下载加载模型从models/Stable-diffusion/目录读取模型文件启动服务最后会显示一个http://127.0.0.1:7860的地址这个过程第一次可能要几分钟之后启动就快了。当你看到命令行里出现Running on local URL: http://127.0.0.1:7860就说明成功了。浏览器会自动打开或者你手动复制这个地址到浏览器。这里有个常见卡点卡在 installing requirements。这个问题的原因通常是网络问题导致 pip 下载依赖超时。解决办法有两个一是换国内 pip 源二是直接用整合包里预装的依赖如果整合包完整的话不应该出现这一步。换 pip 源的方法是在启动脚本里加一行set PIP_INDEX_URLhttps://pypi.tuna.tsinghua.edu.cn/simple或者直接修改整合包里的pip.ini文件。3.4 界面初识别被一堆参数吓到第一次打开 WebUI界面上密密麻麻全是选项很容易懵。其实你只需要先关注这几个区域左上角模型选择下拉框里选你要用的 CheckpointPrompt 输入框正面提示词描述你想要的画面Negative Prompt负面提示词描述你不想要的东西采样参数区Steps、CFG Scale、采样器、尺寸Generate 按钮点它就出图其他像 ControlNet、ADetailer、LoRA 这些都是进阶功能先不用管。4. 模型决定出图风格的核心变量4.1 Checkpoint、LoRA、VAE 到底有什么区别这三个概念新手最容易搞混我用一个类比来解释Checkpoint大模型相当于一个画师的“整体风格”。你选了什么大模型出图就偏向什么风格。比如写实模型出真人二次元模型出动漫。LoRA微调模型相当于给画师加了一个“特定技能包”。比如你想让画师专门会画某个角色、某种服装、某个姿势就挂一个对应的 LoRA。VAE变分自编码器相当于“色彩滤镜”。它负责把模型内部的潜空间数据解码成最终图像影响的是色彩和细节表现。三者的关系是大模型是基础LoRA 是叠加VAE 是收尾。你可以只用一个 Checkpoint 出图也可以叠加多个 LoRA再配一个 VAE。4.2 热门模型类型与选择建议市面上的模型大致分几类类型特点代表方向写实类出真人照片皮肤质感强适合人像、产品图二次元类动漫风格线条清晰适合插画、角色设计2.5D 类介于写实和二次元之间适合游戏原画、概念图通用类什么都能画但都不精适合新手练手新手我建议先下一个通用类模型熟悉基本操作后再根据需求换专用模型。模型文件放在models/Stable-diffusion/目录下刷新界面就能在左上角看到。注意不同模型对提示词的敏感度不一样。有些模型吃“masterpiece, best quality”这类质量词有些模型加了反而变差。换模型之后最好重新试几组提示词。4.3 LoRA 的加载与权重调节LoRA 文件放在models/Lora/目录下。在 WebUI 里你可以通过两种方式调用第一种是在提示词里直接写lora:文件名:权重比如lora:my_character:0.8第二种是点开界面上的 LoRA 面板点击对应的 LoRA 卡片它会自动插入到提示词里。权重范围一般是 0 到 1超过 1 可能会让画面崩坏。多个 LoRA 叠加时总权重不要超过 1.5否则容易互相干扰。我一般习惯主 LoRA 给 0.7-0.8辅助 LoRA 给 0.3-0.5。4.4 VAE 的坑颜色发灰怎么办如果你出图发现颜色发灰、对比度低大概率是 VAE 没配对。有些大模型内置了 VAE有些需要你手动挂一个。常见的 VAE 文件放在models/VAE/目录下然后在设置里指定。WebUI 的设置路径是Settings - Stable Diffusion - SD VAE选好之后点Apply settings。如果选了None还是发灰说明模型本身的问题换一个模型试试。5. 提示词你和模型之间的唯一语言5.1 提示词的基本结构一个好的提示词通常包含这几个层次质量词masterpiece, best quality, ultra detailed主体描述1girl, solo, long hair, blue eyes动作/姿势standing, looking at viewer, hands on hips环境/背景outdoor, forest, sunlight风格/光线cinematic lighting, depth of field, 8k顺序上越靠前的词权重越高。所以把最重要的内容放前面。5.2 权重语法让模型听话的技巧WebUI 支持几种权重写法(word)权重乘以 1.1((word))权重乘以 1.21(word:1.5)权重直接设为 1.5[word]权重除以 1.1我一般用(word:1.2)这种明确写法比堆括号直观。但要注意权重不是越高越好。超过 1.5 容易让画面出现伪影超过 2.0 基本就崩了。5.3 负面提示词不写会后悔负面提示词的作用是告诉模型“别画这些东西”。新手最容易忽略它结果出图各种畸形手、多根手指、模糊背景。一组通用的负面提示词模板lowres, bad anatomy, bad hands, text, error, missing fingers, extra digit, fewer digits, cropped, worst quality, low quality, normal quality, jpeg artifacts, signature, watermark, username, blurry这组词能解决大部分基础问题。如果你画的是特定内容还可以针对性加词比如画人物加extra limbs画风景加people。5.4 提示词不是越长越好我见过有人写了几百个词的提示词结果出图反而乱七八糟。原因是模型对提示词的理解有上限通常 75 个 token 为一个 chunk超出的部分会被截断或稀释。所以提示词要精准而不是冗长。与其写一堆同义词不如把核心要素写清楚。比如你想要“一个女孩在森林里”就写1girl, forest不用写a beautiful girl standing in a dense green forest with tall trees。6. 出图参数Steps、CFG、采样器怎么选6.1 采样步数的甜点区前面提过Steps 一般 20-30 就够。但不同采样器的最佳步数不一样。比如 Euler a 在 20 步就能出不错的效果而 DPM 2M Karras 建议 25-30 步。我的习惯是先用 25 步试一张看效果再调整。如果画面有噪点加到 30如果已经很好降到 20 省时间。6.2 CFG Scale 的调节逻辑CFG 控制提示词的“约束力”。低 CFG 画面更有创意但可能偏离提示词高 CFG 更贴合提示词但画面容易僵硬。CFG 范围效果1-3几乎不听话画面随机4-6有创意适合艺术风格7-10平衡区最常用11-15严格听话但可能过饱和16画面崩坏不推荐6.3 采样器的选择采样器决定了去噪的具体算法。常见的有Euler a速度快画面柔和适合二次元DPM 2M Karras质量高细节好通用推荐DPM SDE Karras更细腻但慢DDIM老牌采样器稳定但不够锐利新手直接用DPM 2M Karras就行它是目前综合表现最好的之一。6.4 分辨率与宽高比SD 1.5 的基础训练分辨率是 512x512SDXL 是 1024x1024。如果你用 1.5 的模型跑 1024x1024画面会出现“双头”“重复肢体”等问题因为模型没见过这么大的图。正确做法是用基础分辨率出图再用高清修复Hires. fix放大。高清修复会先按基础分辨率生成再放大并补充细节效果比直接跑大图好得多。宽高比方面常见的比例有1:1512x512头像、方图3:2768x512横版风景2:3512x768竖版人像16:9912x512宽屏壁纸7. 常见问题与排查技巧实录7.1 启动类问题问题现象可能原因解决办法双击 bat 闪退路径有中文/空格移到纯英文路径卡在 installing requirementspip 源慢换国内源报错 No module named xxx依赖缺失运行 update.bat端口被占用7860 被别的程序用了加--port 7861显存不足报错显存太小加--medvram或--lowvram7.2 出图类问题画面全黑或全灰通常是 VAE 问题换一个 VAE 或者检查模型是否完整。人物手指畸形这是 SD 的老毛病。解决办法有加负面提示词bad hands用 ADetailer 插件专门修手或者用 ControlNet 的 openpose 控制姿势。画面模糊检查 Steps 是否太低CFG 是否太低或者模型本身质量不行。也可以开 Hires. fix 放大。出图速度极慢检查是否用了 CPU 跑应该用 GPU是否开了 xformers显卡驱动是否最新。7.3 模型类问题换了模型出图风格没变可能是模型没加载成功检查文件是否完整刷新界面重新选。LoRA 不生效检查 LoRA 文件是否放在正确目录提示词里的文件名是否写对权重是否太低。模型下载后无法识别检查文件后缀是否为.safetensors或.ckpt文件大小是否正常太小说明没下载完。避坑技巧下载模型时先看文件大小对不对。一个正常的 Checkpoint 至少 2GB如果只有几百 MB说明下载中断了。另外.safetensors格式比.ckpt更安全优先选前者。7.4 性能优化技巧如果你觉得出图慢可以试试这几个方法开启 xformersN 卡用户提速明显降低采样步数从 30 降到 20速度提升 30%用小分辨率出图再放大比直接跑大图快关闭实时预览设置里可以关掉每步预览省资源批量出图时用固定种子避免重复计算我自己实测下来同一张图优化前后速度能差一倍以上。尤其是 xformers开启后从 8 秒一张降到 5 秒一张效果很直观。8. 从能用到好用几个进阶方向8.1 ControlNet让画面听你指挥ControlNet 是 SD 生态里最重要的插件之一。它允许你用一张参考图来控制生成结果的构图、姿势、边缘等。常见的控制类型有OpenPose控制人物姿势Canny控制边缘轮廓Depth控制景深结构Scribble涂鸦转精图装好 ControlNet 插件后还需要下载对应的模型文件放在models/ControlNet/目录下。使用时在界面下方展开 ControlNet 面板上传参考图选好控制类型和权重即可。8.2 图生图与重绘图生图img2img是在一张已有图的基础上重新生成。它的核心参数是Denoising Strength重绘幅度0.2-0.4微调保留原图大部分内容0.5-0.7中等改动风格会变但构图保留0.8-1.0几乎重新生成只保留大致结构这个功能常用于照片修复、风格转换、草图细化。比如你有一张模糊的老照片可以用低重绘幅度跑一遍细节会清晰很多。8.3 面部修复与细节增强SD 出图时人脸往往不够精细尤其是远景人物。解决办法是装ADetailer插件它会自动检测人脸并单独重绘。原理是先出整图然后框出人脸区域用更高的分辨率重新生成脸部最后贴回去。这个插件几乎是人像出图的必备。装好之后在界面下方启用选face_yolov8n.pt模型即可。8.4 批量出图与工作流当你需要大量出图时手动一张张点太慢。WebUI 支持两种批量方式Batch count同一组提示词跑多张Batch size一次同时生成多张吃显存更高级的玩法是用X/Y/Z plot脚本可以对比不同参数组合的效果。比如 X 轴放不同模型Y 轴放不同 CFG一次性跑出一张对比图非常直观。9. 我踩过的那些坑你可以直接跳过9.1 不要频繁更新很多人看到整合包有更新就手痒结果更新完发现插件不兼容、模型加载失败。我的建议是能用就别动。如果当前版本稳定没有你急需的新功能就不要更新。如果一定要更新先备份整个目录。9.2 模型不是越多越好新手容易陷入“收集模型”的怪圈下载了几十个模型结果常用的就那两三个。我的做法是按需下载用完就删。留 3-5 个常用模型就够了其他的等需要时再下。9.3 提示词要自己积累网上的提示词模板可以参考但不能照搬。因为不同模型对提示词的反应不一样。我建议你建一个自己的提示词库把出图效果好的组合记下来慢慢就形成自己的风格了。9.4 显存不够时的取舍显存不够时优先降分辨率其次降批量大小最后才考虑换显卡。512x512 出图再放大比直接跑 1024 省显存得多。另外关闭其他占显存的程序比如浏览器、游戏也能挤出一些空间。9.5 出图结果要筛选SD 出图有随机性同一组参数跑十张可能只有两三张能用。这是正常的不要觉得是自己参数没调好。专业的工作流也是大量出图然后筛选所以批量出图能力很重要。10. 关于后续扩展的一些个人经验这套东西跑通之后你会发现能玩的方向很多。比如用 ComfyUI 搭复杂工作流用 API 接入自己的程序用 LoRA 训练自己的角色。但这些都是后话先把基础打牢。我个人在实际操作中的体会是部署只是起点真正的功夫在提示词和参数调优上。同样一个模型不同的人用出图质量能差出好几个档次。所以别急着装一堆插件先把基础出图练熟把提示词写明白把参数调明白后面再扩展就顺理成章了。最后再分享一个小技巧如果你不确定某个参数的作用就用 X/Y/Z plot 跑一组对比图。比如你想知道 CFG 7 和 10 的区别就设 X 轴为 CFG跑 7、8、9、10 四张图一眼就能看出差异。这比看十篇教程都管用。
网站建设高端定制企业官网