
今天展示的案例是一个基于ComfyUI 的 Omnigen2 图生图工作流,通过输入原始图像与文本提示词,结合噪声生成、潜空间参考以及双重条件引导的机制,实现了透明晶体质感的人物再创作效果。整个流程以清晰的阶段设计串联,从模型加载、图像输入、文本编码到采样生成与解码输出,既保留了基础扩散模型的稳定性,又在材质表现和光影细节方面进行了强化。借助该工作流,可以直观体验 ComfyUI 在创意图像生成上的灵活性与精细度。文章目录工作流介绍核心模型Node节点工作流程大模型应用CLIPTextEncode 文本语义嵌入生成CLIPTextEncode (Negative Prompt) 负向语义控制使用方法应用场景开发与应用工作流介绍该工作流构建在 Omnigen2 扩散模型的基础之上,结合 Qwen 语言视觉文本编码器与 Lumina VAE,完成了从提示词到晶体材质人物的全流程生成。其结构包含模型加载、输入图像处理、条件信息提取、噪声引导采样以及解码保存等模块。通过多路参考潜变量与双条件引导机制,生成结果在保持原图形态的同时融入了晶体材质的质感特征,最终得到细节丰富、通透感强的图像成品。核心模型本工作流的核心模型体系涵盖了扩散模型、文本编码器和变分自编码器(VAE)。扩散模型 Omnigen2_fp16 提供了主要的图像生成能力;文本编码器 qwen_2.5_vl_fp16 负责解析提示词与负面提示词,将语言特征转化为潜在条件向量;VAE 模块则在潜空间与像素空间之间完成双向转换,既能将输入图像压缩到潜空间中作为参考,也能将采样结果解码为可视化图像。这三者形成了稳定而紧密的协作关系,使得工作流能够兼顾生成质量、语义一致性与图像细节还原。模型名称说明omnigen2_fp16.safetensors扩散模型,负责核心图像生成,适合高细节与创意再现qwen_2.5