Stable Diffusion Web UI 界面详解

midjourney中文站 2026-08-03 09:32:43

Hello,大家好,欢迎来到本期的 Web UI 学习内容。本节课将带大家了解 Stable Diffusion Web UI 的主界面结构及各核心参数的功能与含义。

Stable Diffusion 模型

此处显示所有已下载的大模型。在同一组提示词下,不同大模型生成的图像效果存在明显差异:有的模型侧重写实风格,有的则专精二次元风格。

工作原理简述

在输入提示词后,系统首先通过文本编码器(Text Encoder)将提示词转换为特征向量;随后,这些向量被送入潜在空间(Latent Space),在该空间中经历多次降噪处理;最后,VAE 解码器(Variational Autoencoder Decoder)将降噪后的特征向量还原为像素级图像。

用户可手动选择 VAE 编码器与解码器模型,通常使用默认模型即可。

CLIP 模型

文本编码器依赖 CLIP 模型理解提示词语义。“CLIP 停止层数”参数控制文本理解深度:数值越小,模型对提示词细节的响应越强,生成结果中提示词元素越丰富。

文生图模块

该模块支持通过文本提示生成对应图像,分为正向提示词与反向提示词两部分:

  • 正向提示词:描述希望图像中出现的内容。例如输入“one girl, garden”,将生成一位女孩身处花园的图像。
  • 反向提示词:指定不希望出现在图像中的元素。例如在反向提示词中添加“golden hair”,可避免生成金发人物,使发色自动调整为其他颜色(如黑色)。

若使用秋月版 Web UI 安装包,界面右侧常设提示词快捷栏。点击“青少年”可自动向正向提示词添加对应描述;点击“book”则加入书籍元素,操作便捷直观。

采样方法(Sampler)

下拉菜单中提供多种采样算法。推荐优先选用 DPM++ 系列,其中带有 “SD” 标识的变体倾向于增强图像动态表现力,而无标识版本则更注重每步迭代的稳定性。

DPM++ 2M 表示采用二阶多步法,兼顾速度与质量。实际应用中,该算法表现稳定且兼容性良好。

迭代步数(Steps)

指图像生成过程中执行降噪的总次数。步数越高,图像细节越丰富,但同时会延长生成时间,并可能因过度优化导致失真。常规建议设置为 20–30 步。

高清修复(High Resolution Fix)

在基础图像生成完成后,对该图像进行超分辨率增强处理,提升画面清晰度与细节表现力。

Refiner 模块

包含两个关键参数:“模型”与“切换时机”。

以选用 DreamShaper 模型、切换时机设为 0.8 为例:当整体迭代进度达到 80%(如总步数为 20,则在第 16 步时),系统将切换至 Refiner 模型继续完成剩余步骤(即后 4 步)。前段由基础模型(如 Anything V5)主导,后段由 Refiner 模型精细优化。

启用任一模块前,需手动勾选对应开关。

图像尺寸与 CFG(Classifier-Free Guidance Scale)

宽度与高度决定输出图像的分辨率比例,二者必须为 8 的整数倍,否则无法正常生成图像。

CFG 控制提示词对生成过程的约束强度:

  • 值较低(如 1–3)时,AI 创作自由度高,提示词影响减弱;
  • 值较高(如 12–20)时,输出更严格贴合提示词描述,但可能牺牲自然感;
  • 常规推荐范围为 5–10。

随机种子(Seed)

每张生成图像均对应唯一随机种子,可视为该图像的“数字身份证”。在所有参数完全一致的前提下,相同种子值可在不同设备上复现完全相同的图像结果。

ADetailer 模块

专用于人脸区域精细化修复。当生成图像中人物面部结构异常(如五官错位、模糊或畸变)时,启用此模块可自动识别并修正脸部区域,显著提升人像质量。