ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

ComfyUI与Stable Diffusion AI绘画完全指南

ComfyUI与Stable Diffusion AI绘画完全指南 —— 从零搭建ComfyUI工作流、模型管理、提示词工程到商业应用全攻略【文档说明】本文档面向AI绘画入门用户和进阶创作者。从Stable Diffusion的基础原理讲起,涵盖ComfyUI的安装配置、工作流搭建、模型下载管理、提示词工程、ControlNet/LoRA使用、图生视频等全链路内容。全文约16000字。第一章:Stable Diffusion基础原理1.1 什么是Stable Diffusion?Stable Diffusion是一种基于潜在扩散模型(Latent Diffusion Model)的深度学习图像生成模型。由Stability AI、Runway ML和慕尼黑大学的研究者共同开发,于2022年8月开源发布。与DALL-E 2和Midjourney不同,Stable Diffusion是完全开源的,任何人都可以在自己的电脑上免费运行和使用。这是它能够成为AI绘画社区核心工具的根本原因。Stable Diffusion的工作原理可以简化为三个阶段:首先,文本编码器(CLIP Text Encoder)将你的提示词(prompt)转化为计算机可以理解的数值向量。然后,U-Net(一种深度学习网络架构)在这个向量引导下,从纯随机噪声开始逐步"去噪"——每一步都根据文本内容调整图像中的像素分布。最后,解码器(VAE Decoder)将去噪后的潜在空间表示还原为高清图像。这个"从噪声到图像"的过程被称为"扩散过程的反向"。正向扩散是将一张图像逐步加噪直到变成纯噪声,而反向扩散(图像生成)就是从纯噪声出发,根据文本引导一步步去除噪声,最终生成匹配文本描述的图像。Stable Diffusion的伟大之处在于,它在"潜在空间"中进行扩散——这意味着它操作的是一个压缩后的图像表示(48x64的潜在张量对应512x512像素的图像),而非直接操作每张图像的数百万个像素点。这使得整个过程的计算效率提升了数十倍。1.2 核心概念解释Checkpoint(大模型):Stable Diffusion的核心模型文件,包含训练好的所有参数。不同的Checkpoint有不同的画风——有的擅长写实摄影(如Realistic Vision、ChilloutMix),有的擅长二次元动漫(如Anything V5、Counterfeit),有的擅长3D渲染风格(如DreamShaper、RevAnimated)。Checkpoint文件通常以.ckpt或.safetensors格式保存,体积在2GB-7GB之间。.safetensors是社区推荐的安全格式,不含恶意代码。VAE(变分自编码器):用于优化图像色彩的模型组件。好的VAE可以让图像颜色更鲜艳、细节更丰富。常用的VAE包括vae-ft-mse-840000(通用型,色彩校正效果明显)和SDXL系列VAE。LoRA(低秩适配模型):一种轻量级的模型微调方法。LoRA文件通常只有2MB-200MB,可以在不影响大模型的前提下,为生成结果增加特定的风格、人物或物体。例如角色LoRA可以让Stable Diffusion稳定生成同一个人物的不同姿态,风格LoRA可以模仿特定画家的笔触。LoRA的权重可以在0-2之间调节,权重越高效果越明显但可能破坏画面整体性。Embedding(文本嵌入/反向提示词):一种通过修改提示词嵌入向量来实现特定效果的小文件(通常几十KB)。最常见的用途是"负面嵌入"——将一些不良特征(如畸形手指、模糊画质)编码到提示词的负面空间中,让模型自动避开这些特征。著名的负面嵌入包括bad-hands-5、bad-pictures-5-neg等。CFG Scale(分类器自由引导尺度):控制模型对提示词的遵循程度。值越高(如15-20),图像越严格匹配提示词但可能失真;值越低(如3-5),模型自由度越高但可能偏离提示词。通用推荐值为7-9。Sampler(采样器):控制去噪过程的算法。不同采样器的迭代步数和效果不同。常用采样器包括Euler a(快速、效果不错)、DPM++ 2M Karras(质量高、推荐使用)、DDIM(确定性强、可复现)、LCM(极速采样4-8步即可出图)。Steps(采样步数):去噪过程的迭代次数。步数越多细节越丰富但生成时间越长。SD1.5模型推荐20-30步,SDXL模型推荐25-40步,LCM模型仅需4-8步。1.3 SD1.5 vs SDXL vs SD3 vs FluxStable Diffusion生态中有多个主要版本,每个版本的特点和适用场景不同:版本发布时间基础分辨率模型大小特点适用场景SD1.52022年10月512x5122GB生态最成熟、LoRA最多、速度最快通用图像生成、二次元SD2.12022年12月768x7682.5GB画面更清晰、但社区模型较少摄影写实风格SDXL2023年7月1024x10247GB分辨率大幅提升、提示词理解更强高质量绘画、商业设计SD32024年6月
返回列表