ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

本地部署 Stable Diffusion:6GB 显存 5 分钟跑通 768 出图

本地部署 Stable Diffusion:6GB 显存 5 分钟跑通 768 出图 本地部署 Stable Diffusion6GB 显存 5 分钟跑通 768 出图【免费下载链接】stablediffusionHigh-Resolution Image Synthesis with Latent Diffusion Models项目地址: https://gitcode.com/GitHub_Trending/st/stablediffusion手里有一张山脉草图想变成奇幻风插画云端工具要排队本地又不知道从哪下手。Stable Diffusion 是一套可以本地运行的文本生成图像扩散模型这个仓库里还带着风格转换img2img、深度控制、图像修复、4 倍放大这些配套脚本。下面所有命令都以仓库里的真实脚本为准环境装完 5 分钟能出第一张图。项目速览值不值得试项目内容项目定位Stable Diffusion v2 官方代码潜在扩散文生图模型 全套推理脚本核心能力文生图、img2img、深度控制、修复、x4 放大、unCLIP 变体最低硬件6GB 显存以上的 GPU纯 CPU 也能跑IPEX 优化路径上手难度中等conda 装环境后一条命令出图权重需手动下载许可证代码 MIT权重 CreativeML Open RAIL-M社区活跃度StabilityAI 官方维护模型从 2.0 持续更新到 2.1、unCLIP 2.16GB 显存为什么跑得动潜在扩散三句话768×768 的图为什么敢在 6GB 显存上生成因为模型去噪的对象不是像素而是一张压缩过的小图。三个机制各一句原理加一句原因自动编码器先压缩图像被 8 倍下采样成 64×64×4 的潜在表示去噪时只处理 4096 个位置而不是 589824 个像素计算量降一个量级以上——这是显存需求能压到 6GB 的根本原因。实现见 autoencoder.py。文本靠交叉注意力控制方向提示词嵌入注入 UNet 的每一层注意力让每一步去噪都被提示词拽着走——这就是改一个词画面就变的原因。采样器压缩步数DDIM 默认 50 步收敛加--plms或--dpm还能用更少步数不需要上千步迭代。采样器见 ddim.py。⚡️ 5 分钟从零跑通git clone https://gitcode.com/GitHub_Trending/st/stablediffusion cd stablediffusion conda env create -f environment.yaml conda activate ldm pip install -r requirements.txtenvironment.yaml 固定了 python 3.8.5 / pytorch 1.12.1 / cudatoolkit 11.3如果已有 latent-diffusion 环境只需补装 transformers、diffusers、invisible-watermark 再执行pip install -e .。权重不在仓库里去 Hugging Face 的 StabilityAI 组织下载 768 模型v2-1_768-ema-pruned.ckpt放到checkpoints/下然后一条命令出图python scripts/txt2img.py \ --prompt a professional photograph of an astronaut riding a horse \ --ckpt checkpoints/v2-1_768-ema-pruned.ckpt \ --config configs/stable-diffusion/v2-inference-v.yaml \ --H 768 --W 768图片和拼图网格保存在outputs/txt2img-samples/输出自带隐形水印验证方式见 test_watermark.py。不同硬件的差异硬件额外步骤配置NVIDIA GPUCUDA 11.3装 xformers 提速推荐默认配置即可Intel CPU安装 jemalloc、intel-openmp、IPEXintel/v2-inference-v-fp32.yaml--device cpu --torchscript --ipex其他 CPU--device cpu预期分钟级出图fp32 配置 四个高频场景从自己的图到成品图场景一文本生图——出壁纸和素材什么时候用只有想法、没有参考图。python scripts/txt2img.py \ --prompt a professional photograph of an astronaut riding a horse, cinematic lighting \ --ckpt checkpoints/v2-1_768-ema-pruned.ckpt \ --config configs/stable-diffusion/v2-inference-v.yaml \ --H 768 --W 768 --n_samples 4 --seed 42参数取值范围效果--scale1–20默认 9越大越贴提示词过大颜色过饱和v 模型可以设得更高--steps20–50默认 50步数越少越快质量略降--n_samples1–4默认 3一次出几张直接影响显存预期与偏差一次得到 4 张候选手的数量、文字细节不稳定换--seed重掷即可。场景二风格转换——草图变插画img2img什么时候用已有草稿想保留构图只换风格。python scripts/img2img.py \ --prompt A fantasy landscape, trending on artstation \ --init-img assets/stable-samples/img2img/sketch-mountains-input.jpg \ --strength 0.8 \ --ckpt checkpoints/v2-1_768-ema-pruned.ckpt参数取值范围效果--strength0.1–1.0默认 0.80.2 轻微润色0.5 结构与新风平衡0.8 大改1.0 完全丢弃原图像素--ddim_steps20–50默认 50含义同上注意输入图会被自动截成 64 的整数倍比例保持。结果和原图差太多就把 strength 降到 0.5改动不够再提到 0.9。场景三深度控制——布局不变其余全换什么时候用想保留房间布局、人物姿态只换风格或场景。流程是 MiDaS 先给图估出单目深度扩散模型拿文本 深度共同做条件代码见 depth2img.py。前置下载 depth 模型权重和dpt_hybrid-midas-501f0c75.pt放入midas_models/目录然后启动界面python scripts/gradio/depth2img.py configs/stable-diffusion/v2-midas-inference.yaml path-to-ckpt参数取值范围效果strength0–11.0 丢弃全部像素信息只靠文本 深度值越低保留原图越多偏差深度是单目估计远景细结构树枝、栅栏缝隙边缘可能扭曲该模型对写实风格效果最好。场景四修复与放大——补一处、放 4 倍什么时候用照片里删掉一个人或把低清 AI 图放大。python scripts/gradio/inpainting.py configs/stable-diffusion/v2-inpainting-inference.yaml inpainting-ckpt python scripts/gradio/superresolution.py configs/stable-diffusion/x4-upscaling.yaml x4-ckpt参数取值范围效果inpainting 笔刷 提示词—涂出要改的区域提示词描述该处内容未涂区域基本不动upscalingnoise_level0–100真实照片调低对 AI 生成的图官方建议设 100 增加细节偏差x4 放大是文本引导的——换提示词会得到不同材质比如fur会让毛发更细腻。一张图出三个版本unCLIP 变体什么时候用构图满意要几个变体挑。Stable unCLIP 接收 CLIP 图像嵌入用noise_level控制改动幅度文档见 UNCLIP.MD。先下载sd21-unclip-l.ckpt或sd21-unclip-h.ckpt放进checkpoints/streamlit run scripts/streamlit/stableunclip.py参数取值范围效果noise_level0–10000 几乎不变中等值保留主体、改动周围1000 接近重画显存怎么算各档位推荐参数档位推荐配置预期体验6GB512×512 base 模型、DDIM 50 步、n_samples1、装 xformers768 分辨率会 OOM先锁 51212GB768×768 v 模型、单张、默认 autocastn_samples可提到 224GB768×768、n_samples4或--from-file批量提示词批量生成无压力纯 CPUIPEX TorchScriptCPU 支持 bfloat16 就加--bf16分钟级出图适合验证和小批量真正有用的调优手段只有三个xformers内存高效注意力速度和显存的第一优先级--plms/--dpm换更快的采样器先试 20–30 步--n_samples显存最大杠杆OOM 时先砍它边界与避坑做不到什么、怎么绕中文提示词效果明显弱于英文——文本编码器是 OpenCLIP ViT-H/14以英文为主。替代提示词先翻译成英文再生成。生成可读文字——图里的字基本都会糊。替代生成时留白后期在图像软件里排版加字。多主体空间关系——红方块在蓝球上方这类指令经常错位。替代逐个主体生成再合成或用深度控制锁住布局。⚠️768×768 多张会 OOM——6GB 卡在 768 分辨率下n_samples≥2是最常见的爆点。替代换 512 base 模型、n_samples1、或装 xformers。⚠️v2.1 模型 fp16 可能数值不稳定——README 明确提示 vanilla attention 下 fp16 会出问题。用 xformers 时以ATTN_PRECISIONfp16启动脚本。偏见与内容风险——权重是研究产物官方声明不建议直接用于生产服务。替代对外发布前加内容过滤和人工审核层。 三条进阶路径图像变体Stable unCLIP——适合想把一张图做出多个版本的人 →streamlit run scripts/streamlit/stableunclip.py用noise_level控制改动幅度Karlo 文本先验——适合想直接以 768 分辨率做文生图的人 → Karlo 权重下载到checkpoints/karlo_models/界面里选use_karlo见 UNCLIP.MDCPU 生产级加速——适合没有 GPU 的服务器部署 → 换configs/stable-diffusion/intel/配置加--torchscript --ipex支持 bf16 的 CPU 再加--bf16一套权重覆盖文本、图像、深度、修复、放大五个场景。先跑通文本生图再回来调 strength 和 noise_level。【免费下载链接】stablediffusionHigh-Resolution Image Synthesis with Latent Diffusion Models项目地址: https://gitcode.com/GitHub_Trending/st/stablediffusion创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表