大家好,今天来学习图生图的基本概念。
AI绘画的第一次大规模破圈,始于各大平台短视频中的AI绘画特效。只需用手机自拍一张照片,系统就能将其转化为二次元风格的画面。这类视频普遍具有不错的流量表现,例如将真人照片转为日漫风、赛博朋克风,或油画风等。当然,过程中也常出现“翻车”案例,比如把嘟嘟唇识别成M唇,或将小狗画成人脸。那么,这些效果究竟是如何实现的呢?
这就不得不提到Stable Diffusion(SD)这项开源AI绘画技术。它于2022年8月正式免费开放,其诞生方式与以往的AI绘画应用有本质区别——不同于短视频平台内置的AI滤镜,或美图秀秀等工具中的轻量级AI功能,SD能在秒级时间内生成高度精细的图像,并支持以原始图片为基准进行风格迁移与内容重绘。这种“以图生图”的能力,在SD中被称为“图生图”(Image-to-Image)。
借助图生图技术,我们不仅可以将二次元人物转为写实风格,也能将真人照片转化为二次元、油画、机甲、水墨等多种艺术风格。例如,一位机车女孩可被重构为未来感十足的AI机甲少女形象。
接下来进入正式学习阶段,分为两个主要板块:
图生图与文生图类似,同样依赖正向提示词与反向提示词。不同之处在于:除了文字输入外,图生图还引入了“图像输入”作为关键信息源。文字提供语义引导,而图像则提供构图、色彩、姿态等视觉先验信息。
经过上节课的学习,大家已了解文生图存在固有的随机性——即便使用完全相同的提示词,多次生成结果仍可能差异显著。例如两张都标注“白色长裙”的图像,在不同采样步数下呈现的效果可能模糊、失真甚至偏离预期。这种不确定性源于AI对文本指令的理解偏差,本质上是信息传递过程中的天然损耗。
这在日常生活中也十分常见。比如玩“你画我猜”时,即使画者尽力表达,观者仍常误解原意;又如甲方提出设计需求,但设计师因缺乏直观参照,难以准确还原意图。此时,提供一张参考图,便能极大降低理解偏差——图像是比语言更直接、更稳定的信息载体。
图生图正是基于这一逻辑:当我们给SD一张参考图,AI便以此为基础,在保留原图结构的前提下,按提示词要求进行风格迁移或细节重绘。例如,以名画《亨利·怀特夫人》为输入,提取其白色长裙、灰色背景、红色沙发等元素,再辅以精准提示词,即可在保留构图关系的同时,完成二次元风格化转换。
图生图中,输入图片不仅决定画面基础框架,更直接影响生成结果的稳定性与还原度。其工作原理是:对原图进行加噪—去噪的迭代过程,逐像素分析颜色、明暗、边缘等特征,并依据提示词引导重新渲染。例如,AI识别出原图中某区域为白色衣料、某处为深棕沙发、背景呈灰调,便据此重建符合新风格的对应区域,最终输出风格统一、结构合理的图像。
图生图的基本操作可归纳为三步:导入图片 → 编写提示词 → 调整参数。
下面我们以“将真人照片转为二次元风格”为例,进行实际操作演示: