AI绘画入门:图生图原理与实操指南

midjourney中文站 2026-09-01 13:46:08

大家好,今天来学习图生图的基本概念。

AI绘画的第一次大规模破圈,始于各大平台短视频中的AI绘画特效。只需用手机自拍一张照片,系统就能将其转化为二次元风格的画面。这类视频普遍具有不错的流量表现,例如将真人照片转为日漫风、赛博朋克风,或油画风等。当然,过程中也常出现“翻车”案例,比如把嘟嘟唇识别成M唇,或将小狗画成人脸。那么,这些效果究竟是如何实现的呢?

这就不得不提到Stable Diffusion(SD)这项开源AI绘画技术。它于2022年8月正式免费开放,其诞生方式与以往的AI绘画应用有本质区别——不同于短视频平台内置的AI滤镜,或美图秀秀等工具中的轻量级AI功能,SD能在秒级时间内生成高度精细的图像,并支持以原始图片为基准进行风格迁移与内容重绘。这种“以图生图”的能力,在SD中被称为“图生图”(Image-to-Image)。

借助图生图技术,我们不仅可以将二次元人物转为写实风格,也能将真人照片转化为二次元、油画、机甲、水墨等多种艺术风格。例如,一位机车女孩可被重构为未来感十足的AI机甲少女形象。

接下来进入正式学习阶段,分为两个主要板块:

一、图生图原理

1. 基本概念解析

图生图与文生图类似,同样依赖正向提示词与反向提示词。不同之处在于:除了文字输入外,图生图还引入了“图像输入”作为关键信息源。文字提供语义引导,而图像则提供构图、色彩、姿态等视觉先验信息。

经过上节课的学习,大家已了解文生图存在固有的随机性——即便使用完全相同的提示词,多次生成结果仍可能差异显著。例如两张都标注“白色长裙”的图像,在不同采样步数下呈现的效果可能模糊、失真甚至偏离预期。这种不确定性源于AI对文本指令的理解偏差,本质上是信息传递过程中的天然损耗。

这在日常生活中也十分常见。比如玩“你画我猜”时,即使画者尽力表达,观者仍常误解原意;又如甲方提出设计需求,但设计师因缺乏直观参照,难以准确还原意图。此时,提供一张参考图,便能极大降低理解偏差——图像是比语言更直接、更稳定的信息载体。

图生图正是基于这一逻辑:当我们给SD一张参考图,AI便以此为基础,在保留原图结构的前提下,按提示词要求进行风格迁移或细节重绘。例如,以名画《亨利·怀特夫人》为输入,提取其白色长裙、灰色背景、红色沙发等元素,再辅以精准提示词,即可在保留构图关系的同时,完成二次元风格化转换。

2. 图片传递信息的作用

图生图中,输入图片不仅决定画面基础框架,更直接影响生成结果的稳定性与还原度。其工作原理是:对原图进行加噪—去噪的迭代过程,逐像素分析颜色、明暗、边缘等特征,并依据提示词引导重新渲染。例如,AI识别出原图中某区域为白色衣料、某处为深棕沙发、背景呈灰调,便据此重建符合新风格的对应区域,最终输出风格统一、结构合理的图像。

二、图生图操作方法

图生图的基本操作可归纳为三步:导入图片 → 编写提示词 → 调整参数。

下面我们以“将真人照片转为二次元风格”为例,进行实际操作演示:

  1. 导入图片:打开Stable Diffusion界面,切换至图生图(img2img)模式。界面中央有一个方框,用于上传参考图。可通过双击方框选择文件,或直接拖拽图片至该区域。
  2. 编写提示词:以最简提示词“a boy”为例,初步观察生成效果。可见人物姿态、背包、背景等大体结构已被保留,但细节(如墨镜、棕色帽子、手部动作)尚未准确呈现。
  3. 调整参数
    • 重绘幅度(Denoising Strength):取值范围为0–1。数值越高,AI越倾向于脱离原图、自由发挥;数值越低,则越忠实于原图。真人转二次元建议设置在0.6–0.8之间,本次设为0.7。
    • 图像尺寸:应与原图长宽比一致。例如原图分辨率为600×800(即3:4),则需同步设置宽度=600、高度=800,避免形变。
    • 采样器与步数:推荐使用DPM++ 2M Karras,采样步数设为30。
    • 提示词引导系数(CFG Scale):默认7即可,过高易导致过拟合,过低则削弱提示词作用。
    • 质量类提示词:建议加入通用高质量前缀,如“masterpiece, best quality, ultra-detailed”,以及负面提示词如“low quality, bad anatomy, deformed hands”等。