Skip to content
🗂️ 文章分类: AI  
🏷️ 文章标签: ComfyUI  AI  工作流  
📅 文章创建时间: 2026-07-15
🕘️ 文章最后更新时间:2026-08-04

[toc]

ComfyUI笔记2

comfyui_2026-07-13_093918_022.png

常用官方节点

分类功能常见节点
模型加载加载各种模型Checkpoint Loader、CLIP Loader、UNet Loader、VAE Loader、LoRA Loader
文本处理处理提示词CLIP Text Encode
图像生成生成图像KSampler、Empty Latent Image
图像处理处理图像VAE Encode、VAE Decode、Load Image、Preview Image
控制网络控制生成过程ControlNet Loader、ControlNet Apply

模型加载节点

Checkpoint 加载器节点(Checkpoint 模型加载)

comfyui_2026-07-28_103432_042.png

Checkpoint加载器节点是一个模型加载器节点,用于一次性加载完整的Checkpoint模型(包含 UNet+CLIP+VAE)。这个节点会自动检测并加载models/checkpoints文件夹下的所有模型文件。

一个Checkpoint模型文件通常包含了UNet、CLIP、VAE 三个部分的组件。即一个checkpoint模型文件就是完整的图像生成模型。

输入输出

  • 输入:选择对应的 checkpoint 模型文件(通常是 .safetensors格式)。
  • 输出:
    • VAE:VAE 模型对象,供给 VAE 编码/解码节点使用
    • CLIP:CLIP 文本模型对象,供给文本编码器节点使用
    • 模型:模型对象,用于图像去噪生成的主要扩散模型,是AI绘画的核心组件。

注意事项

  • 模型兼容性:确保所选的模型与你的工作流的其他节点兼容,不同的模型(如SD1.5、SDXL、Flux等)需要配合相应的采样器和其他节点。

注意:Checkpoint加载器节点是一个集成节点,该节点适合快速搭建基础工作流。如果需要分别加载UNet、CLIP、VAE 三个组件,就需要分别使用各个组件的加载器节点。

示例

UNet 加载器节点(UNet 模型加载)

comfyui_2026-07-28_150654_461.png

UNet 加载器节点只用于加载 UNet(卷积网络)模型。UNet模型是图像生成模型中的核心组件,负责整个图像生成的降噪计算。

该节点会自动检测并加载位于 models/diffusion_models 文件夹中的模型。

早期图像生成模型的内部是包含UNet+CLIP+VAE三个组件的。因此需要用checkpoint加载器节点一次性加载完整模型(包含UNet+CLIP+VAE三个组件模型)。

在新一代图像生成模型中(如Wan,Flux等),为了方便对模型优化和迭代,都将一个完整的图像生成模型文件(包含 UNet+CLIP+VAE 组件),拆分为三个独立的模型文件。

因此如果要使用新一代图像生成模型,需要分开加载这三个组件。其中UNet 加载器节点只加载 UNet 模型,不加载其他组件。

输入输出

  • 输入:选择对应的 UNet 模型文件。(通常是 .safetensors格式)。
  • 输出:可调用的 UNet 模型对象,供给其他节点使用。

示例

注意:确保所选的UNet 模型与你的工作流的其他节点兼容,不同的模型(如SD1.5、SDXL、Flux、Wan等)需要配合相应的UNet 模型。错配的UNet 会图像生成失败。

VAE (变分自编码器)加载器节点(VAE 模型加载)

comfyui_2026-07-28_152916_909.png

核心功能:只加载 VAE(变分自编码器) 模型文件,为图像编码/解码提供模型基础,本身不直接处理潜在图像。

该节点会检测并加载位于 models/vae 文件夹下的模型。

输入输出

  • 输入:选择对应的 VAE 模型文件。
  • 输出:可调用的 VAE 模型对象,可以供给VAE 编码节点和VAE 解码节点使用。

注意:确保所选的VAE 模型与你的工作流的其他节点兼容,不同的模型(如SD1.5、SDXL、Flux等)需要配合相应的VAE 模型。错配的 VAE 会导致画面发灰、偏色、模糊。

CLIP 加载器节点 (加载CLIP 文本编码器模型)

comfyui_2026-07-28_153913_053.png

该节点主要用于单独加载 CLIP 文本编码器模型。为文本编码提供模型基础,本身不直接处理提示词。

该节点会检测并加载位于 models/text_encoders,models/clip 文件夹下的模型。

支持的模型格式有: .ckpt,.pt,.bin,.pth,.safetensors等格式

输入输出

  • 输入:选择对应的 CLIP 模型文件。
  • 输出:可调用的 CLIP 模型对象,供给文本编码器使用。

注意:不同的生成模型(例如 SD1.5/SDXL/Wan)必须搭配对应的 CLIP 文本模型,错配会导致提示词失效,提示词编码失败等问题。

LoRA 加载器节点(仅模型)

comfyui_2026-07-28_171844_138.png

LoRA = 低秩微调轻量模型,用于修改给定的图像模型的风格、画风、构图、细节特征,而不用改动图像模型本身。

此节点专门用于加载LoRA模型,而无需CLIP模型。该节点会检测位于 models/loras 文件夹下的模型。

如果需要加载多个LoRA 模型,你可以直接将多个LoRA 加载器节点进行串联。

输入输出

  • 输入:
    • 获取图像模型对象。可以是checkpoint模型或UNet模型对象。
    • 指定要加载的LoRA 模型文件。
    • 输入 LoRA 模型强度参数。通常使用0~1之间, 取值越大, 模型调整的效果越明显。
  • 输出:已被 LoRA模型 修改后的图像模型。

LoRA 模型作用

你可以简单把 LoRA 模型理解为滤镜,它通过对图像模型进行微调,从而可以让你的图片具有特定的风格、内容、细节等。

  • 使画面具有特定的画风(如水墨画)
  • 使人物具有某类人物的特征(如某些游戏角色)
  • 使画面具有特定的细节

简而言之,LoRA 可以在不改动图像模型本体的前提下,动态叠加 LoRA 特征权重,从而精准复刻指定画风和角色特征,灵活控制影响强度,是固定画风/角色生成的关键节点。

LoRA 加载器节点

comfyui_2026-08-03_104327_703.png

此节点专门用于加载LoRA模型和CLIP模型的组合。该节点会检测位于 models/loras 文件夹下的模型。

输入输出

  • 输入:
    • 模型:即主模型对象。
    • CLIP 模型:即文本编码器模型对象。
    • LoRA 模型:需要从 models/loras 文件夹中选择的LoRA模型文件。
    • 模型强度:模型强度参数。取值范围-100.0 到 100.0 ,日常使用0~1之间, 取值越大调整的效果越明显。
    • CLIP 强度:CLIP 模型强度参数。取值范围-100.0 到 100.0 ,日常使用0~1之间, 取值越大调整的效果越明显。
  • 输出:
    • 输出被LoRA调整了的主模型对象
    • 输出被LoRA调整了的CLIP模型对象

注意:如果需要加载多个LoRA 模型,你可以直接将多个LoRA 加载器节点进行串联。

文本处理节点

CLIP 文本编码器节点(提示词处理)

comfyui_2026-07-28_155000_036.png

CLIP 文本编码器节点用于调用已加载的 CLIP 文本模型,将人类书写的自然语言提示词,转换为 AI 画图模型能识别的数字向量编码。

输入输出

  • 输入:输入提示词文本。输入 CLIP 模型对象。可以从CLIP 加载器节点获取。
  • 输出:
    • 条件:此处的条件就是经过处理后的提示词向量。供给图像生成模型使用。

图像生成节点

空白Latent图像节点

comfyui_2026-07-28_160827_843.png

空白的潜在空间图像节点,用于生成或操作的空白潜在空间图像,类似空白画布。为进一步的图像合成或修改过程提供了基础。空白潜在图像是作为图像的初始基底。

相当于给 图像生成模型 准备好一张指定尺寸的 “空白画布”。纸上一开始全是随机噪点,后续图像生成模型就在这张纸上画画并不断迭代。

输入输出

  • 输入:要生成的潜在图像的宽度、高度、批量生成数量(一次出几张图)
  • 输出:空白潜在图像,格式是压缩后的潜空间(Latent)数据。就是初始噪点画布,送入采样器节点。

注意:Latent潜在空间图像是 AI 画图专用的压缩格式,尺寸只有真实图片的 1/8 左右,运算速度会快很多;AI 全程都在这个图像里作画。

示例

缩放Latent图像节点(放大/缩小 潜在图像)

comfyui_2026-07-29_145824_738.png

缩放Latent图像节点用于把原图的潜空间图像数据(Latent)放大/缩小到指定尺寸。它通过设置尺寸和缩放算法,来灵活调整潜在图像的尺寸。

输入输出

  • 输入:
    • 潜在图像数据。
    • 目标尺寸(宽度、高度)
    • 不同的缩放算法会影响缩放图像的质量和特性。
    • 如何裁剪放大后的图像,影响输出的最终外观和尺寸。
  • 输出:缩放后的潜在图像数据。

设置Latent噪波遮罩节点(添加遮罩到潜在图像,用于局部重绘)

comfyui_2026-08-01_171246_852.png

该节点主要用于对图像编码后的latent图像,在遮罩区域添加额外的噪声来进行局部的重绘。

输入输出

  • 输入:
    • 潜在图像数据Latent。
    • 遮罩数据。
  • 输出:合并后的潜在图像数据(Latent)数据。

局部重绘中采样器设置的denoise降噪强度,当设置的值越小时,生成的图像会保持和原图越高的相似度。

K Sampler节点(K采样器节点,生成图像)

comfyui_2026-07-28_165545_449.png

K采样器节点是图像生成中的核心节点,该节点主要作用就是采样。即在潜在图像上反复迭代降噪,一步步把噪点图像变成目标画面。

什么是采样?

采样就是在图像生成过程中给图像进行去噪的过程。

工作过程

  1. 首先,K采样器节点会获取到提供的模型对象和正、负两种条件,原始潜在图像。
  2. 然后,它会根据设定好的seed随机种子和denoise降噪强度,先给原始潜在图像加入一些噪声,然后根据提供的模型对象和正、负两种条件,去生成图像。

注意:K采样器节点是文生图中的核心节点。它需要同时接收模型(怎么画)、提示词(画什么)和尺寸(画多大)三个数据信息,才能生成图像。输出的是潜在图像。后续需要交给 VAE 解码成肉眼可见的正常图片

输入输出

  • 输入:
    • 模型对象,可以是checkpoint模型对象或UNet模型对象。
    • 正面/负面条件(来自 CLIP 文本编码器输出的提示词)
    • 空白潜在图像(空白Latent图像节点输出的空白潜在图像)
  • 输出:降噪完成的潜空间图像(Latent),依然是 AI 内部格式,肉眼无法直接查看。后续需要交给 VAE 解码成肉眼可见的正常图片。
seed 随机种子

核心作用:决定初始噪点的排列规律,相当于画面的 “基因编号”。同一个种子 + 完全相同的其他参数,能 100% 复现同一张图。不同的随机种子,会导致不同的画面生成结果。

优化建议:

  • 找灵感阶段:seed数值随机生成,批量出图,挑选出满意的构图和氛围。
  • 微调图片阶段:先固定种子数值,只修改提示词/小参数,保证画面整体构图不变、只调整画面细节,这样效率最高。

注意:随机种子的取值范围是 0-4294967295。

steps 采样步数

核心作用:决定采样器在空白潜在图像上迭代的次数。简而言之就是 AI 迭代画面的次数。步数越少生成越快,步数越多细节越完整,但达到「收敛点」后再加步数,画质几乎不会提升,纯浪费时间。

不同模型对应采样步数的推荐值:

  • SD-1.5模型:20~28 步
  • SDXL模型:24~35步
  • Z-Image-Turbo模型:8步
  • Wan2.1模型:24~28步
cfg 提示词强度

核心作用:控制 AI “听不听提示词的话”。数值越低,AI 越自由发挥;数值越高,越严格贴合你写的提示词描述。

  • 太低(❤️):提示词几乎失效,画面随机感强,内容容易跑偏。
  • 太高(>10):画面僵硬、色彩过饱和、细节重复(俗称 “CFG 烧了”),反而会变糊、出现畸形元素。

不同模型对应CFG的推荐值:

  • SD-1.5模型:建议5~7。首选6
  • SDXL模型:建议5~8。首选7
  • Z-Image-Turbo模型:3~5。首选4
  • Wan2.1模型:6~7

注意:先按推荐cfg值来,觉得画面不符合描述就加 0.5~1,觉得画面僵硬不自然就减 0.5~1。

denoise 降噪强度 / 重绘强度

核心作用:denoise 降噪强度,有的场景下叫重绘强度。作用是对参考图的改动幅度,0 = 完全和原图一致,1 = 完全重新生成。

注意:仅图生图场景生效,纯文生图相当于是 1(完全重绘)。降噪强度的取值范围是 0-1。

适用场景:

  • 0.1~0.3:微改动,只优化画质、光影、色彩,构图主体几乎不变(比如照片修复、提清晰度)。
  • 0.3~0.5:轻度重绘,保留主体构图,更换画风、细化细节(比如照片转动漫)。
  • 0.5~0.7:中度重绘,主体大致保留,细节和背景大幅修改。
  • 0.7~0.9:重度重绘,只保留大致轮廓,几乎重新创作。
  • 0.9 以上:接近纯文生图,参考图只剩极浅的影子。

优化技巧:想保留原图结构就往低调,想大改就往高调;想完全重新创作就往1。

采样算法节点(对模型采样算法优化)

如图是Flux模型的专属采样算法节点。 comfyui_2026-07-29_101820_888.png

不同架构的模型(传统 SD、Wan 视频、Qwen、Flux),采样的底层逻辑完全不一样,必须用对应的采样算法节点,不然要么报错,要么画面直接崩坏。

为什么需要采样算法节点?

在早期的图像生成模型(例如传统 SD 模型)全都是标准离散扩散架构,因此这些模型内部都使用的同一套的标准采样算法。并且在K采样器节点中,也内置了这一套标准采样算法。

这导致在使用这些模型的时候,不需要单独使用采样算法节点,只需要使用K采样器节点,并在其中设置采样算法即可。

但是在新一代的图像生成模型(Wan / Qwen / Flux / Z-Image-Turbo)中,各个模型使用了各自不同的专属采样算法。而K采样器节点中,没有内置这些采样算法。

因此在使用这些模型的时候,除了需要使用K采样器节点,还需要单独使用专属的采样算法节点。否则会导致生成结果异常。

采样算法节点的作用

采样算法节点主要是通过改造模型本身,完全不碰图片数据。通过告诉画图模型,需要用哪一种采样算法来生成图像。

  • 输入:模型对象。
  • 输出:模型对象。

例如将采样算法节点的输入端连接到UNet Loader节点。然后将该节点的输出端与K采样器节点连接起来。这样模型和采样算法的参数就会被传递给K采样器节点。

示例图

图像处理节点

预览图像节点(显示生成的图像)

comfyui_2026-07-29_144121_339.png

预览图像节点获取图像数据,并将其呈现出来。

加载图像节点(加载外部图像,添加图像遮罩)

comfyui_2026-07-29_145059_594.png

该节点用于加载外部图像,例如从文件系统中加载一张图片。

  • 输入:该节点需要接收图像文件路径。
  • 输出:输出图像数据。以及为图像提供的遮罩输出(可选),在图像包含用于透明度的场景中非常有用。

如何给图像添加遮罩?

① 右键点击该节点,在菜单中选择"打开遮罩编辑器"。

comfyui_2026-08-01_163154_911.png

② 在遮罩编辑器上,就可以给图像添加遮罩了。然后点击保存按钮即可。

comfyui_2026-08-01_163311_719.png

VAE编码节点(将正常图片转换为潜在图像)

comfyui_2026-07-28_162228_283.png

核心功能:调用VAE模型,把正常 RGB 图片编码成潜空间图像(Latent)。通常用于图生图场景中。

输入输出

  • 输入
    • 像素:是指正常 RGB 图像数据。
    • VAE:要使用的VAE模型对象。可以从VAE 加载器节点获取。
  • 输出:潜在图像(Latent)数据,格式是压缩后的潜空间数据, AI 内部格式,肉眼无法直接查看。
注意:有的模型内置了VAE编码功能,那么就可以直接使用模型的内置VAE编码功能,而无需单独使用VAE编码节点。

VAE编码(局部重绘)节点 (专门用于局部重绘场景)

comfyui_2026-08-01_163540_669.png

VAE编码(局部重绘)节点用于将图像转换为潜空间图像,并且额外提供遮罩提供给模型。从而让采样器知道该对遮罩部分进行去噪(重新生成)。

该节点适合用于对于局部重绘替换成与原始图像完全不相关的内容。

输入输出

  • 输入
    • 像素:是指正常 RGB 图像数据。
    • VAE:要使用的VAE模型对象。可以从VAE 加载器节点获取。
    • 遮罩:是指图像的遮罩数据,用于指定需要重绘的区域。
  • 输出:附加了遮罩的潜在图像(Latent)数据。

注意:使用此节点时,请勿将采样器中的denoise降噪强度设置过低,否则将出现重绘后图像蒙版区域为灰白色块情况。

VAE解码节点(将潜在图像转换为正常图片)

comfyui_2026-07-28_162633_667.png

核心功能:调用VAE模型,把潜空间图像数据,解码还原成我们肉眼可以查看的正常 RGB 图片。

输入输出

  • 输入
    • 潜在图像(Latent)数据,格式是压缩后的潜空间数据, AI 内部格式,肉眼无法直接查看。
    • VAE:要使用的VAE模型对象。可以从VAE 加载器节点获取。
  • 输出:正常 RGB 图片。肉眼可以直接查看。

ControlNet 相关节点

加载ControlNet模型 节点

comfyui_2026-08-04_104816_043.png

该节点会检测位于 models/controlnet 文件夹下的模型。

该节点设计用于从指定路径加载一个ControlNet模型。然后初始化ControlNet模型对象提供给其他节点使用。

  • 输入:指定需要加载的ControlNet模型文件路径。
  • 输出:输出ControlNet模型对象。提供给其他节点使用。

应用ControlNet 节点

comfyui_2026-08-04_114553_818.png

节点说明

如图所示,这三个节点都是用于应用ControlNet模型的。其中有两个节点即将过期,因此目前建议使用 应用ControlNet(旧版高级) 这个节点。

目前 ComfyUI 为了保证兼容性,在许多工作流中应该还可以看到 应用ControlNet(旧版) 节点,但是目前已经无法通过搜索或者节点列表看到 应用ControlNet(旧版) 节点,所以请使用 应用ControlNet(旧版高级) 这个节点。

节点作用

应用ControlNet(旧版高级) 这个节点的作用是 将 ControlNet 模型,控制图, 正负面条件 结合在一起,从而输出一个符合控制图的图像的正向条件/负向条件。

输入输出

输入

  • 正向条件/负向条件:来自 CLIP文本编码器或者其它条件输入
  • ControlNet:要使用的ControlNet模型对象。
  • 图像:用于ControlNet应用的图片,注意此处的图片不是原图,而是需要经过预处理器处理好的控制图。例如姿态图,深度图,线稿图等。
  • VAE: 要使用的VAE模型输入。
  • 强度: 用来控制网络调整的强度。建议取值在0.5~1.5之间比较合理,越小则模型会发挥越高的自由度,越大则会被限制得越严格。过高会出现很诡异的画面。
  • 开始百分比start_percent: 取值 0.000~1.000,确定开始应用controlNet的百分比,比如取值0.2,意味着ControlNet的引导将在扩散过程完成20%时开始影响图像生成。
  • 结束百分比end_percent: 取值 0.000~1.000,确定结束应用controlNet的百分比,比如取值0.8,意味着ControlNet的引导将在扩散过程完成80%时停止影响图像生成。

输出

  • 正面条件/负向条件:经过ControlNet 处理后的正向条件/负向条件数据,可以输出到下一个ControlNet 节点 或者 K采样器节点。

注意事项

ComfyUI官方的 应用ControlNet 节点只接受「经过预处理器处理好的控制图(不是原图)」。该节点不会自动把普通图像转换成姿态骨架图/深度图/线稿图等。

这个「普通图 → 控制图」的转换步骤,就是预处理器的工作,但是ComfyUI 官方不带预处理器,所以如果要用预处理器,目前需要通过安装第三方自定义节点包来实现。

例如ComfyUI_controlnet_aux自定义节点包,该节点包包含了多个预处理器节点,用于把普通图像转换为姿态图/深度图/线稿图等类型的控制图。

因此要么把普通图像先经过预处理器处理后,再输入到 应用ControlNet 节点。要么直接使用控制图作为输入图像。

ComfyUI Examples 官方示例工作流工程

ComfyUI_examples是 ComfyUI 官方维护的‌工作流示例仓库‌,提供涵盖文生图、图生图、ControlNet、视频生成等场景的‌可加载 JSON 工作流模板与配置说明‌,用于快速学习节点连接逻辑与参数设置 。‌‌

仓库地址 https://github.com/comfyanonymous/ComfyUI_examples

下面的各个工作流有的来自 ComfyUI_examples 仓库。有的是网上找到的。有的是自己搭建的。

文生图工作流

SDXL 文生图工作流

模型介绍

SDXL模型是一个基于离散扩散架构的图像生成模型。模型内部已经内置了UNet,CLIP,VAE组件。因此只需要用checkpoint 加载器节点加载SDXL模型即可。

使用的模型文件

  • checkpoint 模型文件:sd_xl_base_1.0.safetensors

工作流节点说明如下

  • Checkpoint 加载器节点:一次性加载 SDXL 主模型,同时输出 模型对象、CLIP(双文本编码器)、VAE模型对象。
  • CLIP文本编码器节点:输入并处理正面/负面提示词,输出为AI语言。
  • K采样器节点:进行图像采样。
  • 空latent图像节点:创建一个指定尺寸的空白潜在图像,传递给K采样器节点。这就像给画师准备好一张指定大小的画纸。
  • VAE解码器节点:该节点通过调用VAE模型,将潜在图像转换为正常图像。
  • 预览图片节点:显示生成的图像。

由于SDXL模型依然是标准离散扩散架构,而 K 采样器节点已经内置了对应的采样算法,因此整个工作流不加采样算法节点也可以。加了属于重复操作,没有任何效果提升。

注意事项

  1. 空白潜在图像的尺寸最好设置为1024x1024。因为SDXL模型的最佳图像分辨率就是1024x1024。如果设置为其他尺寸,可能会导致生成结果效果不好。
  2. K采样器节点中,采样器设置为dpmpp_2M(即 DPM++ 2M )。调度器设置为karras。这组搭配效果最好。
  3. SDXL模型的正面提示词和负面提示词,都需要用英文。对中文理解能力有限。

截图

如图所示,当搭建好图中的工作流后,点击运行按钮,程序就会按照工作流的节点顺序依次执行。最终生成一张图像。 comfyui_2026-07-29_103603_052.png

z-image-turbo 文生图工作流

模型介绍

z-image-turbo 模型是新一代拆分式架构的。准确来说不是一个模型,而是三个模型的结合。由阿里巴巴团队开发,是 6B 参数的轻量化极速生成模型,属于 Z-Image 系列的蒸馏加速版,主打「小体积、快速度、消费级显卡就能跑」。

完整可用的 Z-Image-Turbo 是一套由 3 个独立文件 组成的模型,不像SDXL模型那样打包成一个Checkpoint 文件。三个文件如下。

  • UNet 图像生成模型:z_image_turbo_fp16.safetensors(或其他量化版本的)。
  • CLIP 文本模型:qwen_3_4b.safetensors。
  • VAE 编码解码模型:ae.safetensors(模型原配 VAE)。

工作流节点说明如下

  • UNet Loader(UNet加载器节点):只加载UNet模型。
  • CLIP Loader(CLIP加载器节点):加载 CLIP 文本模型。为文本处理提供支持。
  • CLIP Text Encode(CLIP文本编码器节点):输入并处理正面/负面提示词,输出为AI语言。需要连接到 CLIP 加载器节点。
  • KSampler(K采样器节点):用图像生成模型来生成图像(注意生成的是噪声图的潜在图像。人类无法直接识别。不是最终的图像结果)。
  • Empty Latent Image(空latent图像节点):创建一个指定尺寸的空白潜在图像,传递给 KSampler节点。这就像给画师准备好一张指定大小的画纸。
  • VAE Loader(VAE加载器节点):只加载 VAE 模型。
  • VAE Decode(VAE解码器节点):该节点通过VAE模型,将潜在图像转换为图像。用于将计算机画画的结果转换为人类的图像结果。
  • Preview Image(预览图片节点):显示生成的图像。

如图是Z-Image-Turbo模型的文生图工作流图截图 comfyui_2026-07-14_152017_407.png

注意事项

注意:由于新一代模型的拆分式架构,因此不是通过checkpoint 加载器节点加载一个模型即可。而是需要分别使用三个节点去加载UNet,CLIP,VAE模型进行组合使用才行。

Qwen-Image 文生图工作流

模型介绍

Qwen-Image 模型是阿里通义千问团队研发的‌200 亿参数图像生成基础模型‌,核心优势在于‌高保真中文/多语言文字渲染‌、‌复杂版面一次性生成‌及‌图像编辑一致性‌。

Qwen-Image 模型通常用于文生图场景,在图生图场景下效果一般。没有Qwen-Image-Edit模型好用。

图生图工作流

SDXL 图生图工作流

相比文生图工作流,图生图工作流的节点组成是不同的。

工作流节点说明如下(额外说明)

  • 加载图片节点:加载一张图片,作为图生图的原图输入。
  • VAE编码节点:把原图编码成潜空间图像数据(Latent)。通常用于图生图场景中。
  • 缩放Latent图像节点:放大/缩小原图的尺寸,来对应新图的尺寸。
  • K采样器节点:在图生图场景中,可以通过调节降噪强度来控制生成图像相似性,越小越相似,越大越不同。

注意事项

  • 如果我们想要的新图尺寸与原图尺寸不同,可以通过缩放Latent图像节点来实现。

截图

下面用SDXL模型来演示一个基础的图生图工作流。可以看到原图与新图的相似度是不同的。

如图所示 comfyui_2026-07-29_120014_257.png

Qwen-Image-Edit 图生图工作流

模型介绍

Qwen-Image-Edit 模型是在 Qwen-Image 模型的基础上,额外做了大量图像编辑专项训练,专门做图生图 / 图像编辑的衍生专用版。

完整使用Qwen-Image-Edit模型需要用到的模型文件如下:

  • CLIP 文本模型:qwen_2.5_vl_7b_fp8_scaled.safetensors
  • UNet 扩散模型:qwen_image_edit_2509_fp8_e4m3fn.safetensor
  • VAE编码解码模型:qwen_image_vae.safetensors 专属的VAE模型,只能用于Qwen-Image模型。
  • lora 模型(可选使用):qwen-image-edit-2509-lightning-4steps-v1.0-bf16.safetensors,用于增强模型的生成能力。

工作流节点说明如下(额外说明)

  • Load Image(图像加载节点):加载用户提供的原始图片。
  • QwenImageEditPlus(适配Qwen-Image图像的条件编码节点):支持同时输入图像和文本提示词。
  • LoRA Loader(LoRA加载器节点):用于加载 LoRA 模型文件。

图生图与文生图的关键区别:文生图从随机噪声开始生成,图生图从用户提供的原图开始生成。

如图是Qwen-Image图生图工作流的截图 comfyui_2026-07-15_174610_870.png

QwenImageEditPlus节点(适配千问图像的条件编码节点)

这个节点是专门适配千问通义 Qwen-Image-Edit 模型的条件编码节点,支持同时输入图像和文本提示词。

  • 输入:图像、文本提示词、VAE模型
  • 输出:包含图像和文本提示词的条件向量编码,用于图像生成模型。

该节点需要搭配VAE模型使用,该节点会把原图通过 VAE 编码器压缩为初始潜在图像,作为初始图生图的基础。后续采样器基于这个初始潜在图像的基础上进行去噪修改,而非从头生成,从而保证生成的图像主体结构不变。

高清放大工作流

高清放大工作流的作用就是高清修复和放大。目前主要有多种方式实现。

使用场景

图像生成模型其实都有一个最佳的图像分辨率。如果我们想要生成的图像分辨率不是最佳分辨率,就会导致生成结果效果不好。

因此我们在进行图像生成的时候,先使用最佳分辨率来生成图像。然后将图像放大到目标分辨率。这样可以提高图像生成的效率。

潜空间放大

放大原理

潜空间放大的原理是将原图先编码成潜空间图像数据(Latent),然后放大/缩小潜空间图像数据(Latent),最后将Latent图像进行二次采样,然后解码为正常图像。

这种二次采样的方式就相当于图生图场景中的重绘功能。

核心节点

comfyui_2026-07-31_171249_351.png

如图所示是在文生图的工作流中,额外添加了缩放Latent图像节点和K采样器节点。图中也有放大前和放大后的图片对比。

注意事项

图中是通过先放大潜空间图像数据(Latent),再进行二次采样重绘的方式,来实现高清放大。这种方式新图会与原图有一定的差异。

如图所示。二次采样的降噪强度参数,会影响放大后图片的相似度。越小越相似,越大越不同。建议最低0.5。 comfyui_2026-08-01_100047_280.png

传统放大

传统放大是直接通过放大模型来放大原图的尺寸。这种方式的放大效果是直接的,不会改变原图的特征。

如图就是采用放大模型进行图像放大的工作流。 comfyui_2026-08-01_104221_000.png

主要涉及的节点有:

  • 加载放大模型节点:加载放大模型。
  • 使用模型放大图像节点:调用放大模型和原图,输出放大后的图像。
  • 缩放图像节点:将图像调整到目标尺寸。

目前比较推荐的传统放大模型是图中的 RealESRGAN_x4plus 模型。

注意:传统放大的缺点就是显存占用比潜空间放大高。

局部重绘工作流

目前局部重绘有两种方式。

  • 方式1:是在原图上添加遮罩区域后,然后对遮罩区域进行图生图,从而达到局部重绘的效果。
  • 方式2:是在原图上添加遮罩区域后,再将原图和遮罩区域一起编码成潜空间图像数据(Latent),然后对Latent图像进行二次采样,最后解码为正常图像,从而达到局部重绘的效果。

区别

  • 方式1是直接再遮罩区域上进行图生图,因此局部重绘的区域可能会与非遮罩区域有差异。
  • 方式2将原图和遮罩区域一起先编码成潜空间图像数据(Latent)然后一起通过二次采样的方式,来实现局部重绘的效果。这样的话局部重绘的区域会与非遮罩区域保持一致。

注意:局部重绘通常需要搭配对应的局部重绘模型。下图工作流中使用的是基于 SDXL模型的局部重绘模型 sd_xl_base_1.0_inpainting_0.1.safetensors

空白区域重绘

如图所示是空白区域重绘的工作流。 comfyui_2026-08-01_161754_585.png

局部重绘原理

主要是先再原图上添加遮罩,然后对遮罩区域进行图生图,从而达到局部重绘的效果。

本质上也算是图生图工作流中的一种特殊情况。

核心节点

局部重绘工作流的核心节点

  • 加载图像节点:输出图像数据和遮罩数据。
  • VAE编码(局部重绘)节点:可以将添加了遮罩的原图,编码成潜空间图像数据(Latent)。

注意事项

注意:采样器中的denoise降噪强度设置过低,否则将出现重绘后图像蒙版区域为灰白色块情况。

潜空间重绘

如图所示是潜空间重绘的工作流。 comfyui_2026-08-01_170357_839.png

核心节点

相比空白区域重绘,只是将VAE编码(局部重绘)节点替换为下面的节点。

  • 加载图像节点:输出图像数据和遮罩数据。
  • VAE编码节点:将原图编码成潜空间图像数据(Latent)。
  • 设置Latent噪波遮罩节点:将Latent图像数据(Latent)和遮罩数据进行合并,生成新的Latent图像数据(Latent)。

注意事项

空白区域重绘由于是对遮罩区域进行图生图,因此如果降噪强度数值较低,那么重绘后的区域可能会与非遮罩区域有差异。

相比空白区域重绘,潜空间重绘可以再降噪强度数值较低的情况下使用,从而实现局部重绘的效果。

embedding 附加工作流

embedding 模型的作用

embedding 模型本质也是提示词,只不过像“打包的提示词”一样。通过引入embedding模型,我们可以快速地调用预定义好的提示词,从而实现快速赋予生成作品特定的角色特征或风格。

例如只需调用角色 Embedding,就能轻松复现动漫人物形象,或通过风格 Embedding 为画面套用水晶雕塑、涂色书等独特质感。

提前准备

准备①:在使用embedding模型的时候,建议先安装一个自定义节点包。该自定义节点是由作者 pythongosssss 开发的 ComfyUI-Custom-Scripts(界面交互增强脚本)。用于提升ComfyUI的界面交互体验(自动排版节点、大图预览、历史记录、快捷键)。

如图所示。该自定义节点包可以帮我进行embedding模型的提示调用。 comfyui_2026-08-03_100315_378.png

准备②:下载embedding模型。并添加到comfyui的"models/embeddings"目录下。

如图所示 comfyui_2026-08-03_101111_593.png

使用embedding模型

当安装好ComfyUI-Custom-Scripts 节点包和下载好embedding模型后,就可以使用embedding模型了。

直接在文本编码器节点中,按照 ”embedding:模型名称“ 格式添加到正面/负面提示词中即可。

如图所示 comfyui_2026-08-03_101804_697.png

如图可以看到,当安装了ComfyUI-Custom-Scripts 节点包后,就可以在文本编辑器节点中,快捷使用embedding模型了。

Lora 附加工作流

Lora 模型的作用

Lora模型是完全基于模型本体的一小部分模型参数进行训练的微调产物。因此Lora模型不可以独立运行,只能搭配对应的模型本体一起使用。

Lora 模型就像给模型本体 定制了一个扩展包。通过将LoRA模型与模型本体 搭配使用,通过权重调节控制作用强弱,既能固定角色与 IP 形象,也能迁移特定画风,或植入发型、服饰等概念元素。

提前准备

需要先下载模型本体对应的Lora模型。并添加到comfyui的"models/loras"目录下。

如图所示 comfyui_2026-08-03_103405_873.png

使用Lora模型

需要通过Lora加载器节点,将Lora模型加载到工作流中。若需要使用多个Lora模型,可以通过串联的方式,将多个Lora模型加载到工作流中。

如图所示 comfyui_2026-08-03_103605_440.png

ControlNet 附加工作流

ControlNet 介绍

一般情况下,通过图像生成模型生成的图像,会根据文字提示词,自由发挥,人物姿势、物体轮廓很容易画崩、变形。就算是通过图生图的方式,也与原图有很大的差异。

而 ControlNet 就像一根 “定形支架”,强制让图像生成模型 严格按照你给的图片轮廓、姿势、结构去画,不让它乱变形。

如图所示,先将原图通过预处理器,生成控制图。再将控制图通过ControlNet模型,生成图像。 stablediffusion_2026-07-22_215847_095.png

注意:ControlNet模型必须配合对应架构的基础模型协同工作。

如何使用ControlNet模型?

ComfyUI 原生提供了 ControlNet 模型的加载、应用、调度的全套节点,覆盖扩散采样阶段的全部控制逻辑,无需安装任何第三方插件即可使用。

具体节点参考上面内容。

预处理器(ComfyUI controlnet aux 第三方节点包)

ComfyUI 官方只维护核心节点(加载、编码、采样、解码),没有内置「预处理器节点」。关于预处理器节点目前是由社区插件生态维护的。

如何使用预处理器节点?

我们需要再ComfyUI的第三方节点包库中,下载预处理器节点包。目前推荐的预处理器节点包有 ComfyUI controlnet aux 节点包

comfyui_controlnet_aux节点包 是 ComfyUI 生态中最主流、功能最全的第三方 ControlNet 预处理器节点包,由社区开发者 Fannovel16 维护,是绝大多数 ControlNet 工作流的标配组件。

核心优势:

  1. 全类型覆盖:集成了几乎所有主流 ControlNet 对应的预处理器
  2. 多架构兼容:同时适配主流模型架构,参数内置对应优化。
  3. xinsir 专属适配优化:针对 xinsir 系列模型做了专属坐标适配(scale_stick 开关),是使用 xinsir 模型的官方推荐配套节点。

预处理器(Preprocessor) 和 ControlNet 模型的关系

各自的作用

预处理器 和 ControlNet 模型是在工作流中起到完全不同的作用。

  • 预处理器:主要从原图中提取结构化信息,生成控制图。是在采样器之前的一个步骤。例如 DWPose 预处理器可以将原图中的姿态信息提取出来,生成姿态控制图。
  • ControlNet 模型:通过读取控制图,在每一步采样中,保证新图的构图/姿态/轮廓不跑偏。

如图所示,先将原图通过预处理器,生成控制图。再将控制图通过ControlNet模型,生成图像。 stablediffusion_2026-07-22_215847_095.png

注意:是先通过预处理器生成控制图,再通过ControlNet模型生成图像。两者是互相搭配的。

注意事项

由于 ControlNet 模型是针对特定类型的控制图训练而成的,因此在使用时需要注意控制图的类型。

  • 例如,Canny ControlNet模型 只认识边缘线控制图,喂给它骨骼图就会完全失效
  • OpenPose ControlNet模型 只认识关节骨架控制图,喂给它深度图就会生成混乱结果

另外注意:不同基础模型对应的ControlNet模型,也不能混用搭配使用。例如 SDXL模型对应 的 ControlNet模型 只能用于 SDXL模型, 不可混用。

ControlNet 模型与基础模型的组合

SDXL 模型

目前对于sdxl模型,推荐搭配使用xinsir_controlnet-union-sdxl-1.0模型。

xinsir_controlnet-union-sdxl-1.0是多合一的ControlNet模型。它包含了 openpose、canny、depth等多个功能。

下载地址:https://huggingface.co/xinsir/controlnet-union-sdxl-1.0

pose 姿态控制

pose 姿态控制,它能够根据原图,生成对应姿势检测图像。

Pose 预处理器节点

如图所示,OpenPose Pose 预处理器节点是来自 comfyui_controlnet_aux 自定义节点包中的节点。节点上还有节点包名称的标签。

comfyui_2026-08-05_222834_217.png

OpenPose Pose预处理器节点的作用是将原图中的姿态信息提取出来,生成姿态控制图。

输入输出

  • 输入:原图
    • detect_hand: 是否检测手部。
    • detect_face: 是否检测人脸。
    • detect_body: 是否检测人体。
    • resolution: 输出的分辨率。
    • scale_stick_for_xinsr_cn: 针对 xinsir 系列模型做了专属坐标适配(scale_stick 开关)。
  • 输出:姿态控制图

注意事项

该节点由于内置了scale_stick_for_xinsr_cn 开关。当使用xinsir系列模型时,需要开启该开关。否则会导致效果异常。非xinsir系列模型,不需要开启该开关。

注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。

工作流示例

如图是示例的工作流 comfyui_2026-08-05_224244_977.png

工作流说明

  • 该工作流中包含了comfyui_controlnet_aux自定义节点包中的 OpenPose Pose预处理器节点。
  • 基础模型用的是sdxl模型。搭配的controlnet模型是xinsir_controlnet-openpose-sdxl-1.0模型。两者互相搭配。

注意事项

  • 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。

canny 边缘检测

Canny 边缘检测 是一种基于Canny边缘检测算法的ControlNet模型。它能够根据原图,生成对应边缘线控制图。

canny edge 边缘检测预处理器节点

该节点的核心作用是提取画面高对比度硬边缘,输出黑白锐利线条,是最基础的轮廓控制方案。

comfyui_2026-08-06_164006_903.png

如图所示不同的节点,对应不同的处理效果

  • Canny Edge: 标准Canny Edge节点。偏向简笔风格。
  • PyraCanny: 基于Pyramid的Canny Edge节点。

适用场景

  • 建筑、产品、机械结构严格锁定
  • 简笔画/线稿转写实场景
  • 约束物体外形,防止构图跑偏

输入输出

  • 输入:原图
    • resolution: 输出的分辨率。
    • threshold: 边缘检测高低阈值区间。阈值越高线条越少、越简洁;阈值越低线条越多、越复杂。
  • 输出:边缘控制图

注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。

工作流示例

comfyui_2026-08-06_114534_774.png

如图是使用canny 边缘检测 ControlNet模型 的工作流。可以看到通过边缘控制图生成的新图都是符合原图边缘特征的。

工作流说明

  • 该工作流中包含了comfyui_controlnet_aux自定义节点包中的Canny Edge预处理器节点。
  • 基础模型用的是sdxl模型。搭配的controlnet模型是xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Lineart等多个功能。

注意事项

  • 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。

lineart 艺术线稿

LineArt 是一种基于简单艺术线稿的ControlNet模型。它能够根据原图,生成对应的艺术线稿图像。

lineart 艺术线稿控制预处理器节点

如图是三种不同的lineart预处理器节点的使用效果。 comfyui_2026-08-06_150019_232.png

不同的lineart预处理器节点,对应不同的风格。

  • Standard Lineart: 标准艺术线稿控制节点。
  • Realistic Lineart: 真实艺术线稿控制节点。偏向写实风格。
  • Anime Lineart: 动漫艺术线稿控制节点。偏向动漫风格。

comfyui_2026-08-06_151420_222.png

注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。

工作流示例

如图是使用 lineart 艺术线稿 ControlNet模型 的工作流。可以看到通过艺术线稿控制图生成的新图都是符合原图特征的。

工作流说明

  • 该工作流中包含了comfyui_controlnet_aux自定义节点包中的Lineart预处理器节点。
  • 基础模型用的是sdxl模型。搭配的controlnet模型是xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Lineart等多个功能。

注意事项

  • 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。

SoftEdge 软边缘

SoftEdge 是一种基于软边缘检测的ControlNet模型。它能够根据原图,生成对应软边缘检测图像。

SoftEdge 软边缘检测预处理器节点

comfyui_2026-08-06_155115_654.png

如图不同的SoftEdge 软边缘检测预处理器节点,对应不同的处理效果。

  • HED Soft-Edge Lines: 基于HED模型的软边缘检测,输出软边缘检测图。
  • PiDiNet Soft-Edge Lines: 基于PiDiNet模型的软边缘检测,输出软边缘检测图。

注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。

工作流示例

comfyui_2026-08-06_163254_800.png

如图是使用 SoftEdge 软边缘检测 ControlNet模型 的工作流。可以看到通过软边缘检测生成的新图都是符合原图特征的。

工作流说明

  • 该工作流中包含了comfyui_controlnet_aux自定义节点包中的SoftEdge预处理器节点。
  • 基础模型用的是sdxl模型。搭配的controlnet模型是xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Lineart等多个功能。

注意事项

  • 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。

depth 深度图

Depth 是一种基于深度图的ControlNet模型。它能够根据原图,生成对应深度图图像。

depth 深度图预处理器节点

comfyui_2026-08-06_153651_831.png

如图是各个深度图预处理器节点的使用效果。

  • Depth Anything: 通用深度图预处理器节点,支持多种场景。
  • Depth Anything V2: 新一代深度估计算法,复杂场景、边缘细节的识别精度远高于 Midas。
  • Midas Depth Map: 估算画面深度信息,输出灰度深度图(近亮远暗),锁定前后空间层次。
  • Zoe Depth Anything: 基于Zoe模型的深度图预处理器节点,支持多种场景。

注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。

工作流示例

comfyui_2026-08-06_154618_056.png

如图是使用 depth 深度图 ControlNet模型 的工作流。可以看到通过深度图生成的新图都是符合原图特征的。

工作流说明

  • 该工作流中包含了comfyui_controlnet_aux自定义节点包中的Depth预处理器节点。
  • 基础模型用的是sdxl模型。搭配的controlnet模型是xinsir_controlnet-union-sdxl-1.0模型。这个模型是多功能ControlNet模型,包含了Canny Edge、OpenPose、Depth等多个功能。

注意事项

  • 图像尺寸要根据基础模型的最佳生成分辨率来设置。否则会导致新图的效果异常。例如sdxl的最佳生成分辨率为1024x1024。

组合使用(多ControlNet搭配使用)

在实际的使用场景中,我们通常会结合使用多个ControlNet模型,以实现更复杂,更精确的控制效果。

如图所示,我们组合使用了lineart、OpenPose、Depth三个ControlNet模型,以实现更复杂,更精确的控制效果。 comfyui_2026-08-06_171854_532.png

注意: 通过将多个 应用ControlNet节点 的正负面条件串联起来,以实现多ControlNet模型的组合使用。

注意:由于使用了第三方节点包,因此在使用第三方预处理器节点时,可能会从外网下载一些脚本文件,节点才能正常运行。请确保你的网络环境允许下载。如果下载失败,也可以手动下载脚本文件,然后添加指定的对应目录下。具体说明可以看ComfyUI的终端命令行输出来判断需要下载哪些文件。