Stable Diffusion 提示词语法详解

midjourney中文站 2026-07-27 21:55:48

Hello,大家好,欢迎来到本期 WebUI 学习频道。这节课我们一起来学习 WebUI 中提示词(Prompt)的语法规范与使用技巧。

首先我们来聊聊书写规范:不论是正向提示词还是负向提示词,都必须使用英文及英文标点符号,否则系统可能无法正确识别。例如输入 one girl, garden, yellow dress(一个女孩、花园、黄色裙子),配合生成快捷键 Ctrl+Enter,我们可以得到一张穿着黄色裙子在花园中漫步的女孩图像。

如果改用中文输入“一个女孩,花园,黄色的裙子”,结果会怎样呢?可以看到,虽然图像中确实出现了女孩,但“黄色的裙子”和“花园”并未准确呈现——这说明中文提示词会导致语义丢失或识别偏差。

接下来我们讲解提示词的权重(Weight)。所谓权重,可以理解为该提示词在整体生成过程中的比重或重要性。权重越高,模型对该词的关注度就越高。例如,当提示词 A 的权重为 1.2,而提示词 B 的权重为 0.9 时,A 对画面的影响将明显大于 B。

我们通过以下方式控制权重:

  • 中括号 []:表示 0.9 倍权重,降低提示词重要性;
  • 小括号 ():表示 1.1 倍权重,提升提示词重要性;
  • 大括号 {}:表示 1.05 倍权重,用于微调。

多重括号可叠加计算:两个中括号 [[]] 相当于 0.9 × 0.9 = 0.81 倍权重;两个小括号 (()) 相当于 1.1 × 1.1 = 1.21 倍权重;大括号同理。

此外,WebUI 提供快捷键辅助调整权重:将光标定位到某个提示词(如 garden),按 Ctrl + 上箭头 可逐步增加其权重,按 Ctrl + 下箭头 则逐步降低。但需注意,权重不宜过高,否则易导致图像过拟合、失真或变形。

关于短句与长句:有人会问,为什么提示词常以单词/词组形式罗列,而非自然语言长句?事实上,两种方式均可使用,但目前实践表明,分词式提示词更利于精准控制生成效果,也更便于单独调整各部分权重。若使用长句,则难以对其中某一成分快速加权,需手动添加括号等符号,操作效率较低。当前 AIGC 领域也在持续探索如何让自然语言提示达到与分词提示相当的效果。

提示词总长度同样关键:并非越多越好。研究表明,正向提示词控制在 75 个 token 以内 效果最佳;超过该数量,模型识别准确性下降,整体表现反而减弱。负向提示词同样适用此原则,建议也不超过 75 个 token。

“起手式”是指常用的质量强化前缀,例如 masterpiece4kbest quality 等。这些词汇源于模型训练时所使用的高质量样本,在提示词开头加入它们,有助于提升输出图像的精细度与质感。负向提示词则用于排除不希望出现的内容,例如 blurry(模糊)、text(文字)、low quality(低质量)等,能有效规避相应缺陷。

提示词顺序会影响生成结果。越靠前的提示词,默认权重略高。推荐按如下逻辑组织提示词:

  1. 画质与风格类词汇,如 masterpiece, high quality, detailed
  2. 主体描述,如 one girl, blue dress
  3. 环境、场景、光照与构图,如 garden, soft lighting, shallow depth of field
  4. 可选的 LoRA 或其他模型扩展标识(如有需要)。

提示词污染是指多个提示词之间语义相互干扰的现象。例如颜色词(如 red)可能影响邻近物体的色调。为避免此类问题,可在相关提示词间插入 break 进行隔离。

提示词融合则是将两个概念结合生成新形象的方法。例如输入 one girl, cat,通常生成“女孩与猫”的独立元素;若改为 one girl, end, cat(注意 end 必须全大写),则可能生成“猫娘”类融合形象。类似效果也可通过下划线(cat_girl)或竖线分隔的括号结构实现,如 {cat|girl},其原理是交替绘制前后关键词,最终融合成新形态。

最后是时间段控制:可通过时间轴权重分配指定不同阶段生成内容。例如希望前 30% 步骤绘制森林、后 70% 绘制女孩,可写作:
{forest:one girl:0.3}
若将 0.3 改为 0.7,则变为前 70% 绘制森林、后 30% 绘制女孩。