[toc]
ComfyUI笔记2

常用官方节点
| 分类 | 功能 | 常见节点 |
|---|---|---|
| 模型加载 | 加载各种模型 | Checkpoint Loader、CLIP Loader、UNet Loader、VAE Loader、LoRA Loader |
| 文本处理 | 处理提示词 | CLIP Text Encode |
| 图像生成 | 生成图像 | KSampler、Empty Latent Image |
| 图像处理 | 处理图像 | VAE Encode、VAE Decode、Load Image、Preview Image |
| 控制网络 | 控制生成过程 | ControlNet Loader、ControlNet Apply |
模型加载节点
Checkpoint 加载器节点(Checkpoint 模型加载)

Checkpoint加载器节点是一个模型加载器节点,用于一次性加载完整的Checkpoint模型(包含 UNet+CLIP+VAE)。这个节点会自动检测并加载models/checkpoints文件夹下的所有模型文件。
一个Checkpoint模型文件通常包含了UNet、CLIP、VAE 三个部分的组件。即一个checkpoint模型文件就是完整的图像生成模型。
输入输出
- 输入:选择对应的 checkpoint 模型文件(通常是
.safetensors格式)。 - 输出:
- VAE:VAE 模型对象,供给 VAE 编码/解码节点使用
- CLIP:CLIP 文本模型对象,供给文本编码器节点使用
- 模型:模型对象,用于图像去噪生成的主要扩散模型,是AI绘画的核心组件。
注意事项
- 模型兼容性:确保所选的模型与你的工作流的其他节点兼容,不同的模型(如SD1.5、SDXL、Flux等)需要配合相应的采样器和其他节点。
注意:Checkpoint加载器节点是一个集成节点,该节点适合快速搭建基础工作流。如果需要分别加载UNet、CLIP、VAE 三个组件,就需要分别使用各个组件的加载器节点。
示例
UNet 加载器节点(UNet 模型加载)

UNet 加载器节点只用于加载 UNet(卷积网络)模型。UNet模型是图像生成模型中的核心组件,负责整个图像生成的降噪计算。
该节点会自动检测并加载位于 models/diffusion_models 文件夹中的模型。
早期图像生成模型的内部是包含UNet+CLIP+VAE三个组件的。因此需要用checkpoint加载器节点一次性加载完整模型(包含UNet+CLIP+VAE三个组件模型)。
在新一代图像生成模型中(如Wan,Flux等),为了方便对模型优化和迭代,都将一个完整的图像生成模型文件(包含 UNet+CLIP+VAE 组件),拆分为三个独立的模型文件。
因此如果要使用新一代图像生成模型,需要分开加载这三个组件。其中UNet 加载器节点只加载 UNet 模型,不加载其他组件。
输入输出
- 输入:选择对应的 UNet 模型文件。(通常是
.safetensors格式)。 - 输出:可调用的 UNet 模型对象,供给其他节点使用。
示例
注意:确保所选的UNet 模型与你的工作流的其他节点兼容,不同的模型(如SD1.5、SDXL、Flux、Wan等)需要配合相应的UNet 模型。错配的UNet 会图像生成失败。
VAE (变分自编码器)加载器节点(VAE 模型加载)

核心功能:只加载 VAE(变分自编码器) 模型文件,为图像编码/解码提供模型基础,本身不直接处理潜在图像。
该节点会检测并加载位于 models/vae 文件夹下的模型。
输入输出
- 输入:选择对应的 VAE 模型文件。
- 输出:可调用的 VAE 模型对象,可以供给VAE 编码节点和VAE 解码节点使用。
注意:确保所选的VAE 模型与你的工作流的其他节点兼容,不同的模型(如SD1.5、SDXL、Flux等)需要配合相应的VAE 模型。错配的 VAE 会导致画面发灰、偏色、模糊。
CLIP 加载器节点 (加载CLIP 文本编码器模型)

该节点主要用于单独加载 CLIP 文本编码器模型。为文本编码提供模型基础,本身不直接处理提示词。
该节点会检测并加载位于 models/text_encoders,models/clip 文件夹下的模型。
支持的模型格式有: .ckpt,.pt,.bin,.pth,.safetensors等格式
输入输出
- 输入:选择对应的 CLIP 模型文件。
- 输出:可调用的 CLIP 模型对象,供给文本编码器使用。
注意:不同的生成模型(例如 SD1.5/SDXL/Wan)必须搭配对应的 CLIP 文本模型,错配会导致提示词失效,提示词编码失败等问题。
LoRA 加载器节点(仅模型)

LoRA = 低秩微调轻量模型,用于修改给定的图像模型的风格、画风、构图、细节特征,而不用改动图像模型本身。
此节点专门用于加载LoRA模型,而无需CLIP模型。该节点会检测位于 models/loras 文件夹下的模型。
如果需要加载多个LoRA 模型,你可以直接将多个LoRA 加载器节点进行串联。
输入输出
- 输入:
- 获取图像模型对象。可以是checkpoint模型或UNet模型对象。
- 指定要加载的LoRA 模型文件。
- 输入 LoRA 模型强度参数。通常使用0~1之间, 取值越大, 模型调整的效果越明显。
- 输出:已被 LoRA模型 修改后的图像模型。
LoRA 模型作用
你可以简单把 LoRA 模型理解为滤镜,它通过对图像模型进行微调,从而可以让你的图片具有特定的风格、内容、细节等。
- 使画面具有特定的画风(如水墨画)
- 使人物具有某类人物的特征(如某些游戏角色)
- 使画面具有特定的细节
简而言之,LoRA 可以在不改动图像模型本体的前提下,动态叠加 LoRA 特征权重,从而精准复刻指定画风和角色特征,灵活控制影响强度,是固定画风/角色生成的关键节点。
LoRA 加载器节点

此节点专门用于加载LoRA模型和CLIP模型的组合。该节点会检测位于 models/loras 文件夹下的模型。
输入输出
- 输入:
- 模型:即主模型对象。
- CLIP 模型:即文本编码器模型对象。
- LoRA 模型:需要从
models/loras文件夹中选择的LoRA模型文件。 - 模型强度:模型强度参数。取值范围-100.0 到 100.0 ,日常使用0~1之间, 取值越大调整的效果越明显。
- CLIP 强度:CLIP 模型强度参数。取值范围-100.0 到 100.0 ,日常使用0~1之间, 取值越大调整的效果越明显。
- 输出:
- 输出被LoRA调整了的主模型对象
- 输出被LoRA调整了的CLIP模型对象
注意:如果需要加载多个LoRA 模型,你可以直接将多个LoRA 加载器节点进行串联。
文本处理节点
CLIP 文本编码器节点(提示词处理)

CLIP 文本编码器节点用于调用已加载的 CLIP 文本模型,将人类书写的自然语言提示词,转换为 AI 画图模型能识别的数字向量编码。
输入输出
- 输入:输入提示词文本。输入 CLIP 模型对象。可以从CLIP 加载器节点获取。
- 输出:
- 条件:此处的条件就是经过处理后的提示词向量。供给图像生成模型使用。
图像生成节点
空白Latent图像节点

空白的潜在空间图像节点,用于生成或操作的空白潜在空间图像,类似空白画布。为进一步的图像合成或修改过程提供了基础。空白潜在图像是作为图像的初始基底。
相当于给 图像生成模型 准备好一张指定尺寸的 “空白画布”。纸上一开始全是随机噪点,后续图像生成模型就在这张纸上画画并不断迭代。
输入输出
- 输入:要生成的潜在图像的宽度、高度、批量生成数量(一次出几张图)
- 输出:空白潜在图像,格式是压缩后的潜空间(Latent)数据。就是初始噪点画布,送入采样器节点。
注意:Latent潜在空间图像是 AI 画图专用的压缩格式,尺寸只有真实图片的 1/8 左右,运算速度会快很多;AI 全程都在这个图像里作画。
示例
缩放Latent图像节点(放大/缩小 潜在图像)

缩放Latent图像节点用于把原图的潜空间图像数据(Latent)放大/缩小到指定尺寸。它通过设置尺寸和缩放算法,来灵活调整潜在图像的尺寸。
输入输出
- 输入:
- 潜在图像数据。
- 目标尺寸(宽度、高度)
- 不同的缩放算法会影响缩放图像的质量和特性。
- 如何裁剪放大后的图像,影响输出的最终外观和尺寸。
- 输出:缩放后的潜在图像数据。
设置Latent噪波遮罩节点(添加遮罩到潜在图像,用于局部重绘)

该节点主要用于对图像编码后的latent图像,在遮罩区域添加额外的噪声来进行局部的重绘。
输入输出
- 输入:
- 潜在图像数据Latent。
- 遮罩数据。
- 输出:合并后的潜在图像数据(Latent)数据。
局部重绘中采样器设置的denoise降噪强度,当设置的值越小时,生成的图像会保持和原图越高的相似度。
K Sampler节点(K采样器节点,生成图像)

K采样器节点是图像生成中的核心节点,该节点主要作用就是采样。即在潜在图像上反复迭代降噪,一步步把噪点图像变成目标画面。
什么是采样?
采样就是在图像生成过程中给图像进行去噪的过程。
工作过程
- 首先,K采样器节点会获取到提供的模型对象和正、负两种条件,原始潜在图像。
- 然后,它会根据设定好的seed随机种子和denoise降噪强度,先给原始潜在图像加入一些噪声,然后根据提供的模型对象和正、负两种条件,去生成图像。
注意:K采样器节点是文生图中的核心节点。它需要同时接收模型(怎么画)、提示词(画什么)和尺寸(画多大)三个数据信息,才能生成图像。输出的是潜在图像。后续需要交给 VAE 解码成肉眼可见的正常图片
输入输出
- 输入:
- 模型对象,可以是checkpoint模型对象或UNet模型对象。
- 正面/负面条件(来自 CLIP 文本编码器输出的提示词)
- 空白潜在图像(空白Latent图像节点输出的空白潜在图像)
- 输出:降噪完成的潜空间图像(Latent),依然是 AI 内部格式,肉眼无法直接查看。后续需要交给 VAE 解码成肉眼可见的正常图片。
seed 随机种子
核心作用:决定初始噪点的排列规律,相当于画面的 “基因编号”。同一个种子 + 完全相同的其他参数,能 100% 复现同一张图。不同的随机种子,会导致不同的画面生成结果。
优化建议:
- 找灵感阶段:seed数值随机生成,批量出图,挑选出满意的构图和氛围。
- 微调图片阶段:先固定种子数值,只修改提示词/小参数,保证画面整体构图不变、只调整画面细节,这样效率最高。
注意:随机种子的取值范围是 0-4294967295。
steps 采样步数
核心作用:决定采样器在空白潜在图像上迭代的次数。简而言之就是 AI 迭代画面的次数。步数越少生成越快,步数越多细节越完整,但达到「收敛点」后再加步数,画质几乎不会提升,纯浪费时间。
不同模型对应采样步数的推荐值:
- SD-1.5模型:20~28 步
- SDXL模型:24~35步
- Z-Image-Turbo模型:8步
- Wan2.1模型:24~28步
cfg 提示词强度
核心作用:控制 AI “听不听提示词的话”。数值越低,AI 越自由发挥;数值越高,越严格贴合你写的提示词描述。
- 太低(❤️):提示词几乎失效,画面随机感强,内容容易跑偏。
- 太高(>10):画面僵硬、色彩过饱和、细节重复(俗称 “CFG 烧了”),反而会变糊、出现畸形元素。
不同模型对应CFG的推荐值:
- SD-1.5模型:建议5~7。首选6
- SDXL模型:建议5~8。首选7
- Z-Image-Turbo模型:3~5。首选4
- Wan2.1模型:6~7
注意:先按推荐cfg值来,觉得画面不符合描述就加 0.5~1,觉得画面僵硬不自然就减 0.5~1。
denoise 降噪强度 / 重绘强度
核心作用:denoise 降噪强度,有的场景下叫重绘强度。作用是对参考图的改动幅度,0 = 完全和原图一致,1 = 完全重新生成。
注意:仅图生图场景生效,纯文生图相当于是 1(完全重绘)。降噪强度的取值范围是 0-1。
适用场景:
- 0.1~0.3:微改动,只优化画质、光影、色彩,构图主体几乎不变(比如照片修复、提清晰度)。
- 0.3~0.5:轻度重绘,保留主体构图,更换画风、细化细节(比如照片转动漫)。
- 0.5~0.7:中度重绘,主体大致保留,细节和背景大幅修改。
- 0.7~0.9:重度重绘,只保留大致轮廓,几乎重新创作。
- 0.9 以上:接近纯文生图,参考图只剩极浅的影子。
优化技巧:想保留原图结构就往低调,想大改就往高调;想完全重新创作就往1。
采样算法节点(对模型采样算法优化)
如图是Flux模型的专属采样算法节点。 
不同架构的模型(传统 SD、Wan 视频、Qwen、Flux),采样的底层逻辑完全不一样,必须用对应的采样算法节点,不然要么报错,要么画面直接崩坏。
为什么需要采样算法节点?
在早期的图像生成模型(例如传统 SD 模型)全都是标准离散扩散架构,因此这些模型内部都使用的同一套的标准采样算法。并且在K采样器节点中,也内置了这一套标准采样算法。
这导致在使用这些模型的时候,不需要单独使用采样算法节点,只需要使用K采样器节点,并在其中设置采样算法即可。
但是在新一代的图像生成模型(Wan / Qwen / Flux / Z-Image-Turbo)中,各个模型使用了各自不同的专属采样算法。而K采样器节点中,没有内置这些采样算法。
因此在使用这些模型的时候,除了需要使用K采样器节点,还需要单独使用专属的采样算法节点。否则会导致生成结果异常。
采样算法节点的作用
采样算法节点主要是通过改造模型本身,完全不碰图片数据。通过告诉画图模型,需要用哪一种采样算法来生成图像。
- 输入:模型对象。
- 输出:模型对象。
例如将采样算法节点的输入端连接到UNet Loader节点。然后将该节点的输出端与K采样器节点连接起来。这样模型和采样算法的参数就会被传递给K采样器节点。
示例图
图像处理节点
预览图像节点(显示生成的图像)

预览图像节点获取图像数据,并将其呈现出来。
加载图像节点(加载外部图像,添加图像遮罩)

该节点用于加载外部图像,例如从文件系统中加载一张图片。
- 输入:该节点需要接收图像文件路径。
- 输出:输出图像数据。以及为图像提供的遮罩输出(可选),在图像包含用于透明度的场景中非常有用。
如何给图像添加遮罩?
① 右键点击该节点,在菜单中选择"打开遮罩编辑器"。

② 在遮罩编辑器上,就可以给图像添加遮罩了。然后点击保存按钮即可。

VAE编码节点(将正常图片转换为潜在图像)

核心功能:调用VAE模型,把正常 RGB 图片编码成潜空间图像(Latent)。通常用于图生图场景中。
输入输出
- 输入
- 像素:是指正常 RGB 图像数据。
- VAE:要使用的VAE模型对象。可以从VAE 加载器节点获取。
- 输出:潜在图像(Latent)数据,格式是压缩后的潜空间数据, AI 内部格式,肉眼无法直接查看。
VAE编码(局部重绘)节点 (专门用于局部重绘场景)

VAE编码(局部重绘)节点用于将图像转换为潜空间图像,并且额外提供遮罩提供给模型。从而让采样器知道该对遮罩部分进行去噪(重新生成)。
该节点适合用于对于局部重绘替换成与原始图像完全不相关的内容。
输入输出
- 输入
- 像素:是指正常 RGB 图像数据。
- VAE:要使用的VAE模型对象。可以从VAE 加载器节点获取。
- 遮罩:是指图像的遮罩数据,用于指定需要重绘的区域。
- 输出:附加了遮罩的潜在图像(Latent)数据。
注意:使用此节点时,请勿将采样器中的denoise降噪强度设置过低,否则将出现重绘后图像蒙版区域为灰白色块情况。
VAE解码节点(将潜在图像转换为正常图片)

核心功能:调用VAE模型,把潜空间图像数据,解码还原成我们肉眼可以查看的正常 RGB 图片。
输入输出
- 输入
- 潜在图像(Latent)数据,格式是压缩后的潜空间数据, AI 内部格式,肉眼无法直接查看。
- VAE:要使用的VAE模型对象。可以从VAE 加载器节点获取。
- 输出:正常 RGB 图片。肉眼可以直接查看。
ControlNet 相关节点
加载ControlNet模型 节点

该节点会检测位于 models/controlnet 文件夹下的模型。
该节点设计用于从指定路径加载一个ControlNet模型。然后初始化ControlNet模型对象提供给其他节点使用。
- 输入:指定需要加载的ControlNet模型文件路径。
- 输出:输出ControlNet模型对象。提供给其他节点使用。
应用ControlNet 节点

节点说明
如图所示,这三个节点都是用于应用ControlNet模型的。其中有两个节点即将过期,因此目前建议使用 应用ControlNet(旧版高级) 这个节点。
目前 ComfyUI 为了保证兼容性,在许多工作流中应该还可以看到 应用ControlNet(旧版) 节点,但是目前已经无法通过搜索或者节点列表看到 应用ControlNet(旧版) 节点,所以请使用 应用ControlNet(旧版高级) 这个节点。
节点作用
应用ControlNet(旧版高级) 这个节点的作用是 将 ControlNet 模型,控制图, 正负面条件 结合在一起,从而输出一个符合控制图的图像的正向条件/负向条件。
输入输出
输入
- 正向条件/负向条件:来自 CLIP文本编码器或者其它条件输入
- ControlNet:要使用的ControlNet模型对象。
- 图像:用于ControlNet应用的图片,注意此处的图片不是原图,而是需要经过预处理器处理好的控制图。例如姿态图,深度图,线稿图等。
- VAE: 要使用的VAE模型输入。
- 强度: 用来控制网络调整的强度。建议取值在0.5~1.5之间比较合理,越小则模型会发挥越高的自由度,越大则会被限制得越严格。过高会出现很诡异的画面。
- 开始百分比start_percent: 取值 0.000~1.000,确定开始应用controlNet的百分比,比如取值0.2,意味着ControlNet的引导将在扩散过程完成20%时开始影响图像生成。
- 结束百分比end_percent: 取值 0.000~1.000,确定结束应用controlNet的百分比,比如取值0.8,意味着ControlNet的引导将在扩散过程完成80%时停止影响图像生成。
输出
- 正面条件/负向条件:经过ControlNet 处理后的正向条件/负向条件数据,可以输出到下一个ControlNet 节点 或者 K采样器节点。
注意事项
ComfyUI官方的 应用ControlNet 节点只接受「经过预处理器处理好的控制图(不是原图)」。该节点不会自动把普通图像转换成姿态骨架图/深度图/线稿图等。
这个「普通图 → 控制图」的转换步骤,就是预处理器的工作,但是ComfyUI 官方不带预处理器,所以如果要用预处理器,目前需要通过安装第三方自定义节点包来实现。
例如ComfyUI_controlnet_aux自定义节点包,该节点包包含了多个预处理器节点,用于把普通图像转换为姿态图/深度图/线稿图等类型的控制图。
因此要么把普通图像先经过预处理器处理后,再输入到 应用ControlNet 节点。要么直接使用控制图作为输入图像。
ComfyUI Examples 官方示例工作流工程
ComfyUI_examples是 ComfyUI 官方维护的工作流示例仓库,提供涵盖文生图、图生图、ControlNet、视频生成等场景的可加载 JSON 工作流模板与配置说明,用于快速学习节点连接逻辑与参数设置 。
仓库地址 https://github.com/comfyanonymous/ComfyUI_examples
下面的各个工作流有的来自 ComfyUI_examples 仓库。有的是网上找到的。有的是自己搭建的。
文生图工作流
SDXL 文生图工作流
模型介绍
SDXL模型是一个基于离散扩散架构的图像生成模型。模型内部已经内置了UNet,CLIP,VAE组件。因此只需要用checkpoint 加载器节点加载SDXL模型即可。
使用的模型文件
- checkpoint 模型文件:sd_xl_base_1.0.safetensors
工作流节点说明如下
- Checkpoint 加载器节点:一次性加载 SDXL 主模型,同时输出 模型对象、CLIP(双文本编码器)、VAE模型对象。
- CLIP文本编码器节点:输入并处理正面/负面提示词,输出为AI语言。
- K采样器节点:进行图像采样。
- 空latent图像节点:创建一个指定尺寸的空白潜在图像,传递给K采样器节点。这就像给画师准备好一张指定大小的画纸。
- VAE解码器节点:该节点通过调用VAE模型,将潜在图像转换为正常图像。
- 预览图片节点:显示生成的图像。
由于SDXL模型依然是标准离散扩散架构,而 K 采样器节点已经内置了对应的采样算法,因此整个工作流不加采样算法节点也可以。加了属于重复操作,没有任何效果提升。
注意事项
- 空白潜在图像的尺寸最好设置为1024x1024。因为SDXL模型的最佳图像分辨率就是1024x1024。如果设置为其他尺寸,可能会导致生成结果效果不好。
- K采样器节点中,采样器设置为dpmpp_2M(即 DPM++ 2M )。调度器设置为karras。这组搭配效果最好。
- SDXL模型的正面提示词和负面提示词,都需要用英文。对中文理解能力有限。
截图
如图所示,当搭建好图中的工作流后,点击运行按钮,程序就会按照工作流的节点顺序依次执行。最终生成一张图像。 
z-image-turbo 文生图工作流
模型介绍
z-image-turbo 模型是新一代拆分式架构的。准确来说不是一个模型,而是三个模型的结合。由阿里巴巴团队开发,是 6B 参数的轻量化极速生成模型,属于 Z-Image 系列的蒸馏加速版,主打「小体积、快速度、消费级显卡就能跑」。
完整可用的 Z-Image-Turbo 是一套由 3 个独立文件 组成的模型,不像SDXL模型那样打包成一个Checkpoint 文件。三个文件如下。
- UNet 图像生成模型:z_image_turbo_fp16.safetensors(或其他量化版本的)。
- CLIP 文本模型:qwen_3_4b.safetensors。
- VAE 编码解码模型:ae.safetensors(模型原配 VAE)。
工作流节点说明如下
- UNet Loader(UNet加载器节点):只加载UNet模型。
- CLIP Loader(CLIP加载器节点):加载 CLIP 文本模型。为文本处理提供支持。
- CLIP Text Encode(CLIP文本编码器节点):输入并处理正面/负面提示词,输出为AI语言。需要连接到 CLIP 加载器节点。
- KSampler(K采样器节点):用图像生成模型来生成图像(注意生成的是噪声图的潜在图像。人类无法直接识别。不是最终的图像结果)。
- Empty Latent Image(空latent图像节点):创建一个指定尺寸的空白潜在图像,传递给 KSampler节点。这就像给画师准备好一张指定大小的画纸。
- VAE Loader(VAE加载器节点):只加载 VAE 模型。
- VAE Decode(VAE解码器节点):该节点通过VAE模型,将潜在图像转换为图像。用于将计算机画画的结果转换为人类的图像结果。
- Preview Image(预览图片节点):显示生成的图像。
如图是Z-Image-Turbo模型的文生图工作流图截图 
注意事项
注意:由于新一代模型的拆分式架构,因此不是通过checkpoint 加载器节点加载一个模型即可。而是需要分别使用三个节点去加载UNet,CLIP,VAE模型进行组合使用才行。
Qwen-Image 文生图工作流
模型介绍
Qwen-Image 模型是阿里通义千问团队研发的200 亿参数图像生成基础模型,核心优势在于高保真中文/多语言文字渲染、复杂版面一次性生成及图像编辑一致性。
Qwen-Image 模型通常用于文生图场景,在图生图场景下效果一般。没有Qwen-Image-Edit模型好用。
图生图工作流
SDXL 图生图工作流
相比文生图工作流,图生图工作流的节点组成是不同的。
工作流节点说明如下(额外说明)
- 加载图片节点:加载一张图片,作为图生图的原图输入。
- VAE编码节点:把原图编码成潜空间图像数据(Latent)。通常用于图生图场景中。
- 缩放Latent图像节点:放大/缩小原图的尺寸,来对应新图的尺寸。
- K采样器节点:在图生图场景中,可以通过调节降噪强度来控制生成图像相似性,越小越相似,越大越不同。
注意事项
- 如果我们想要的新图尺寸与原图尺寸不同,可以通过缩放Latent图像节点来实现。
截图
下面用SDXL模型来演示一个基础的图生图工作流。可以看到原图与新图的相似度是不同的。
如图所示 
Qwen-Image-Edit 图生图工作流
模型介绍
Qwen-Image-Edit 模型是在 Qwen-Image 模型的基础上,额外做了大量图像编辑专项训练,专门做图生图 / 图像编辑的衍生专用版。
完整使用Qwen-Image-Edit模型需要用到的模型文件如下:
- CLIP 文本模型:qwen_2.5_vl_7b_fp8_scaled.safetensors
- UNet 扩散模型:qwen_image_edit_2509_fp8_e4m3fn.safetensor
- VAE编码解码模型:qwen_image_vae.safetensors 专属的VAE模型,只能用于Qwen-Image模型。
- lora 模型(可选使用):qwen-image-edit-2509-lightning-4steps-v1.0-bf16.safetensors,用于增强模型的生成能力。
工作流节点说明如下(额外说明)
- Load Image(图像加载节点):加载用户提供的原始图片。
- QwenImageEditPlus(适配Qwen-Image图像的条件编码节点):支持同时输入图像和文本提示词。
- LoRA Loader(LoRA加载器节点):用于加载 LoRA 模型文件。
图生图与文生图的关键区别:文生图从随机噪声开始生成,图生图从用户提供的原图开始生成。
如图是Qwen-Image图生图工作流的截图 
QwenImageEditPlus节点(适配千问图像的条件编码节点)
这个节点是专门适配千问通义 Qwen-Image-Edit 模型的条件编码节点,支持同时输入图像和文本提示词。
- 输入:图像、文本提示词、VAE模型
- 输出:包含图像和文本提示词的条件向量编码,用于图像生成模型。
该节点需要搭配VAE模型使用,该节点会把原图通过 VAE 编码器压缩为初始潜在图像,作为初始图生图的基础。后续采样器基于这个初始潜在图像的基础上进行去噪修改,而非从头生成,从而保证生成的图像主体结构不变。
高清放大工作流
高清放大工作流的作用就是高清修复和放大。目前主要有多种方式实现。
使用场景
图像生成模型其实都有一个最佳的图像分辨率。如果我们想要生成的图像分辨率不是最佳分辨率,就会导致生成结果效果不好。
因此我们在进行图像生成的时候,先使用最佳分辨率来生成图像。然后将图像放大到目标分辨率。这样可以提高图像生成的效率。
潜空间放大
放大原理
潜空间放大的原理是将原图先编码成潜空间图像数据(Latent),然后放大/缩小潜空间图像数据(Latent),最后将Latent图像进行二次采样,然后解码为正常图像。
这种二次采样的方式就相当于图生图场景中的重绘功能。
核心节点

如图所示是在文生图的工作流中,额外添加了缩放Latent图像节点和K采样器节点。图中也有放大前和放大后的图片对比。
注意事项
图中是通过先放大潜空间图像数据(Latent),再进行二次采样重绘的方式,来实现高清放大。这种方式新图会与原图有一定的差异。
如图所示。二次采样的降噪强度参数,会影响放大后图片的相似度。越小越相似,越大越不同。建议最低0.5。 
传统放大
传统放大是直接通过放大模型来放大原图的尺寸。这种方式的放大效果是直接的,不会改变原图的特征。
如图就是采用放大模型进行图像放大的工作流。 
主要涉及的节点有:
- 加载放大模型节点:加载放大模型。
- 使用模型放大图像节点:调用放大模型和原图,输出放大后的图像。
- 缩放图像节点:将图像调整到目标尺寸。
目前比较推荐的传统放大模型是图中的 RealESRGAN_x4plus 模型。
注意:传统放大的缺点就是显存占用比潜空间放大高。局部重绘工作流
目前局部重绘有两种方式。
- 方式1:是在原图上添加遮罩区域后,然后对遮罩区域进行图生图,从而达到局部重绘的效果。
- 方式2:是在原图上添加遮罩区域后,再将原图和遮罩区域一起编码成潜空间图像数据(Latent),然后对Latent图像进行二次采样,最后解码为正常图像,从而达到局部重绘的效果。
区别
- 方式1是直接再遮罩区域上进行图生图,因此局部重绘的区域可能会与非遮罩区域有差异。
- 方式2将原图和遮罩区域一起先编码成潜空间图像数据(Latent)然后一起通过二次采样的方式,来实现局部重绘的效果。这样的话局部重绘的区域会与非遮罩区域保持一致。
注意:局部重绘通常需要搭配对应的局部重绘模型。下图工作流中使用的是基于 SDXL模型的局部重绘模型 sd_xl_base_1.0_inpainting_0.1.safetensors
空白区域重绘
如图所示是空白区域重绘的工作流。 
局部重绘原理
主要是先再原图上添加遮罩,然后对遮罩区域进行图生图,从而达到局部重绘的效果。
本质上也算是图生图工作流中的一种特殊情况。
核心节点
局部重绘工作流的核心节点
- 加载图像节点:输出图像数据和遮罩数据。
- VAE编码(局部重绘)节点:可以将添加了遮罩的原图,编码成潜空间图像数据(Latent)。
注意事项
注意:采样器中的denoise降噪强度设置过低,否则将出现重绘后图像蒙版区域为灰白色块情况。
潜空间重绘
如图所示是潜空间重绘的工作流。 
核心节点
相比空白区域重绘,只是将VAE编码(局部重绘)节点替换为下面的节点。
- 加载图像节点:输出图像数据和遮罩数据。
- VAE编码节点:将原图编码成潜空间图像数据(Latent)。
- 设置Latent噪波遮罩节点:将Latent图像数据(Latent)和遮罩数据进行合并,生成新的Latent图像数据(Latent)。
注意事项
空白区域重绘由于是对遮罩区域进行图生图,因此如果降噪强度数值较低,那么重绘后的区域可能会与非遮罩区域有差异。
相比空白区域重绘,潜空间重绘可以再降噪强度数值较低的情况下使用,从而实现局部重绘的效果。
embedding 附加工作流
embedding 模型的作用
embedding 模型本质也是提示词,只不过像“打包的提示词”一样。通过引入embedding模型,我们可以快速地调用预定义好的提示词,从而实现快速赋予生成作品特定的角色特征或风格。
例如只需调用角色 Embedding,就能轻松复现动漫人物形象,或通过风格 Embedding 为画面套用水晶雕塑、涂色书等独特质感。
提前准备
准备①:在使用embedding模型的时候,建议先安装一个自定义节点包。该自定义节点是由作者 pythongosssss 开发的 ComfyUI-Custom-Scripts(界面交互增强脚本)。用于提升ComfyUI的界面交互体验(自动排版节点、大图预览、历史记录、快捷键)。
如图所示。该自定义节点包可以帮我进行embedding模型的提示调用。 
准备②:下载embedding模型。并添加到comfyui的"models/embeddings"目录下。
如图所示 
使用embedding模型
当安装好ComfyUI-Custom-Scripts 节点包和下载好embedding模型后,就可以使用embedding模型了。
直接在文本编码器节点中,按照 ”embedding:模型名称“ 格式添加到正面/负面提示词中即可。
如图所示 
如图可以看到,当安装了ComfyUI-Custom-Scripts 节点包后,就可以在文本编辑器节点中,快捷使用embedding模型了。
Lora 附加工作流
Lora 模型的作用
Lora模型是完全基于模型本体的一小部分模型参数进行训练的微调产物。因此Lora模型不可以独立运行,只能搭配对应的模型本体一起使用。
Lora 模型就像给模型本体 定制了一个扩展包。通过将LoRA模型与模型本体 搭配使用,通过权重调节控制作用强弱,既能固定角色与 IP 形象,也能迁移特定画风,或植入发型、服饰等概念元素。
提前准备
需要先下载模型本体对应的Lora模型。并添加到comfyui的"models/loras"目录下。
如图所示 
使用Lora模型
需要通过Lora加载器节点,将Lora模型加载到工作流中。若需要使用多个Lora模型,可以通过串联的方式,将多个Lora模型加载到工作流中。
如图所示 
ControlNet 附加工作流
ControlNet 介绍
一般情况下,通过图像生成模型生成的图像,会根据文字提示词,自由发挥,人物姿势、物体轮廓很容易画崩、变形。就算是通过图生图的方式,也与原图有很大的差异。
而 ControlNet 就像一根 “定形支架”,强制让图像生成模型 严格按照你给的图片轮廓、姿势、结构去画,不让它乱变形。
如图所示,先将原图通过预处理器,生成控制图。再将控制图通过ControlNet模型,生成图像。 
注意:ControlNet模型必须配合对应架构的基础模型协同工作。
如何使用ControlNet模型?
ComfyUI 原生提供了 ControlNet 模型的加载、应用、调度的全套节点,覆盖扩散采样阶段的全部控制逻辑,无需安装任何第三方插件即可使用。
具体节点参考上面内容。
预处理器(ComfyUI controlnet aux 第三方节点包)
ComfyUI 官方只维护核心节点(加载、编码、采样、解码),没有内置「预处理器节点」。关于预处理器节点目前是由社区插件生态维护的。
如何使用预处理器节点?
我们需要再ComfyUI的第三方节点包库中,下载预处理器节点包。目前推荐的预处理器节点包有 ComfyUI controlnet aux 节点包。
comfyui_controlnet_aux节点包 是 ComfyUI 生态中最主流、功能最全的第三方 ControlNet 预处理器节点包,由社区开发者 Fannovel16 维护,是绝大多数 ControlNet 工作流的标配组件。
核心优势:
- 全类型覆盖:集成了几乎所有主流 ControlNet 对应的预处理器
- 多架构兼容:同时适配主流模型架构,参数内置对应优化。
- xinsir 专属适配优化:针对 xinsir 系列模型做了专属坐标适配(scale_stick 开关),是使用 xinsir 模型的官方推荐配套节点。
预处理器(Preprocessor) 和 ControlNet 模型的关系
各自的作用
预处理器 和 ControlNet 模型是在工作流中起到完全不同的作用。
- 预处理器:主要从原图中提取结构化信息,生成控制图。是在采样器之前的一个步骤。例如 DWPose 预处理器可以将原图中的姿态信息提取出来,生成姿态控制图。
- ControlNet 模型:通过读取控制图,在每一步采样中,保证新图的构图/姿态/轮廓不跑偏。
如图所示,先将原图通过预处理器,生成控制图。再将控制图通过ControlNet模型,生成图像。 
注意:是先通过预处理器生成控制图,再通过ControlNet模型生成图像。两者是互相搭配的。
注意事项
由于 ControlNet 模型是针对特定类型的控制图训练而成的,因此在使用时需要注意控制图的类型。
- 例如,Canny ControlNet模型 只认识边缘线控制图,喂给它骨骼图就会完全失效
- OpenPose ControlNet模型 只认识关节骨架控制图,喂给它深度图就会生成混乱结果
另外注意:不同基础模型对应的ControlNet模型,也不能混用搭配使用。例如 SDXL模型对应 的 ControlNet模型 只能用于 SDXL模型, 不可混用。
ControlNet 模型与基础模型的组合
SDXL 模型
目前对于sdxl模型,推荐搭配使用xinsir_controlnet-union-sdxl-1.0模型。
xinsir_controlnet-union-sdxl-1.0是多合一的ControlNet模型。它包含了 openpose、canny、depth等多个功能。
下载地址:https://huggingface.co/xinsir/controlnet-union-sdxl-1.0
pose 姿态控制
pose 姿态控制,它能够根据原图,生成对应姿势检测图像。
Pose 预处理器节点
如图所示,OpenPose Pose 预处理器节点是来自 comfyui_controlnet_aux 自定义节点包中的节点。节点上还有节点包名称的标签。

OpenPose Pose预处理器节点的作用是将原图中的姿态信息提取出来,生成姿态控制图。
输入输出
- 输入:原图
- detect_hand: 是否检测手部。
- detect_face: 是否检测人脸。
- detect_body: 是否检测人体。
- resolution: 输出的分辨率。
- scale_stick_for_xinsr_cn: 针对 xinsir 系列模型做了专属坐标适配(scale_stick 开关)。
- 输出:姿态控制图
注意事项
该节点由于内置了scale_stick_for_xinsr_cn 开关。当使用xinsir系列模型时,需要开启该开关。否则会导致效果异常。非xinsir系列模型,不需要开启该开关。
注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。
工作流示例
如图是示例的工作流 
工作流说明
- 该工作流中包含了comfyui_controlnet_aux自定义节点包中的 OpenPose Pose预处理器节点。
- 基础模型用的是sdxl模型。搭配的controlnet模型是xinsir_controlnet-openpose-sdxl-1.0模型。两者互相搭配。
注意事项
- 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。
canny 边缘检测
Canny 边缘检测 是一种基于Canny边缘检测算法的ControlNet模型。它能够根据原图,生成对应边缘线控制图。
canny edge 边缘检测预处理器节点
该节点的核心作用是提取画面高对比度硬边缘,输出黑白锐利线条,是最基础的轮廓控制方案。

如图所示不同的节点,对应不同的处理效果
- Canny Edge: 标准Canny Edge节点。偏向简笔风格。
- PyraCanny: 基于Pyramid的Canny Edge节点。
适用场景
- 建筑、产品、机械结构严格锁定
- 简笔画/线稿转写实场景
- 约束物体外形,防止构图跑偏
输入输出
- 输入:原图
- resolution: 输出的分辨率。
- threshold: 边缘检测高低阈值区间。阈值越高线条越少、越简洁;阈值越低线条越多、越复杂。
- 输出:边缘控制图
注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。
工作流示例

如图是使用canny 边缘检测 ControlNet模型 的工作流。可以看到通过边缘控制图生成的新图都是符合原图边缘特征的。
工作流说明
- 该工作流中包含了comfyui_controlnet_aux自定义节点包中的Canny Edge预处理器节点。
- 基础模型用的是sdxl模型。搭配的controlnet模型是
xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Lineart等多个功能。
注意事项
- 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。
lineart 艺术线稿
LineArt 是一种基于简单艺术线稿的ControlNet模型。它能够根据原图,生成对应的艺术线稿图像。
lineart 艺术线稿控制预处理器节点
如图是三种不同的lineart预处理器节点的使用效果。 
不同的lineart预处理器节点,对应不同的风格。
- Standard Lineart: 标准艺术线稿控制节点。
- Realistic Lineart: 真实艺术线稿控制节点。偏向写实风格。
- Anime Lineart: 动漫艺术线稿控制节点。偏向动漫风格。

注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。
工作流示例
如图是使用 lineart 艺术线稿 ControlNet模型 的工作流。可以看到通过艺术线稿控制图生成的新图都是符合原图特征的。
工作流说明
- 该工作流中包含了comfyui_controlnet_aux自定义节点包中的Lineart预处理器节点。
- 基础模型用的是sdxl模型。搭配的controlnet模型是
xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Lineart等多个功能。
注意事项
- 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。
SoftEdge 软边缘
SoftEdge 是一种基于软边缘检测的ControlNet模型。它能够根据原图,生成对应软边缘检测图像。
SoftEdge 软边缘检测预处理器节点

如图不同的SoftEdge 软边缘检测预处理器节点,对应不同的处理效果。
- HED Soft-Edge Lines: 基于HED模型的软边缘检测,输出软边缘检测图。
- PiDiNet Soft-Edge Lines: 基于PiDiNet模型的软边缘检测,输出软边缘检测图。
注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。
工作流示例

如图是使用 SoftEdge 软边缘检测 ControlNet模型 的工作流。可以看到通过软边缘检测生成的新图都是符合原图特征的。
工作流说明
- 该工作流中包含了comfyui_controlnet_aux自定义节点包中的SoftEdge预处理器节点。
- 基础模型用的是sdxl模型。搭配的controlnet模型是
xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Lineart等多个功能。
注意事项
- 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。
depth 深度图
Depth 是一种基于深度图的ControlNet模型。它能够根据原图,生成对应深度图图像。
depth 深度图预处理器节点

如图是各个深度图预处理器节点的使用效果。
- Depth Anything: 通用深度图预处理器节点,支持多种场景。
- Depth Anything V2: 新一代深度估计算法,复杂场景、边缘细节的识别精度远高于 Midas。
- Midas Depth Map: 估算画面深度信息,输出灰度深度图(近亮远暗),锁定前后空间层次。
- Zoe Depth Anything: 基于Zoe模型的深度图预处理器节点,支持多种场景。
注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。
工作流示例

如图是使用 depth 深度图 ControlNet模型 的工作流。可以看到通过深度图生成的新图都是符合原图特征的。
工作流说明
- 该工作流中包含了comfyui_controlnet_aux自定义节点包中的Depth预处理器节点。
- 基础模型用的是sdxl模型。搭配的controlnet模型是
xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Depth等多个功能。
注意事项
- 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。
组合使用(多ControlNet搭配使用)
在实际的使用场景中,我们通常会结合使用多个ControlNet模型,以实现更复杂,更精确的控制效果。
如图所示,我们组合使用了lineart、OpenPose、Depth三个ControlNet模型,以实现更复杂,更精确的控制效果。 
注意: 通过将多个 应用ControlNet节点 的正负面条件串联起来,以实现多ControlNet模型的组合使用。
注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。
