ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

如何训练专属 LoRA 模型:kohya_ss 微调 Stable Diffusion 参数指南

如何训练专属 LoRA 模型:kohya_ss 微调 Stable Diffusion 参数指南 如何训练专属 LoRA 模型kohya_ss 微调 Stable Diffusion 参数指南【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss想把某个具体角色、画风或概念稳定地做进 Stable Diffusionkohya_ss 能帮你做到——它是把 Kohya 那套命令行训练脚本包成界面的 GUI填表就能训 LoRA 和全量微调。对只有十几张图、刚入门的普通用户这是上手成本最低的选择之一。它支持 SD1.5/2.x、SDXL、SD3、Flux.1 等基础模型训练方式含 LoRA、LoHa、LoKr、Dreambooth 和 Textual Inversion下文只展开最常用的 LoRA。先解决两个真实问题图和角色对不上做 AI 绘画的人大多踩过这两类坑。第一类你有一个很具体的角色——自己的宠物、原创人物、某部作品里的形象。你让通用模型画它出来的脸时对时错服装发型经常乱怎么堆提示词都抓不住它到底长什么样。第二类你想让画面带上某种统一气质——某个画师的笔触、某种复古胶片色。你只能靠形容词去逼近模型理解的和你想的总差一截换个背景就失效。这两个问题本质是同一件事通用大模型里没有这个具体目标的记忆。LoRA 训练就是往模型里补一份小小的记忆让它稳定地认出并复现你指定的角色、画风或概念而这份记忆只有几十到几百 MB不需要重发整个几十 GB 的大模型。LoRA 到底在学什么一句话讲清原理LoRA 不去改原模型而是在它旁边挂一组极小的旁路网络只训练这些旁路。类比一下原模型是一本写好的百科全书LoRA 是往里面塞几张便签写上这个角色眼睛蓝色、穿红外套。训练时百科全书不动只更新便签。数据流是这样的训练图被压成 latent一种压缩后的中间表示比原图小得多省显存模型给 latent 加噪、再学着把噪去掉这个过程反复进行只有 LoRA 旁路的权重在更新主模型权重全程冻结训练结束导出一个几 MB 到几百 MB 的 .safetensors 文件理解这一点的意义在于训练快、文件小、可叠加。你可以同时挂几个 LoRA一个管角色、一个管画风互不冲突。3 分钟装好并出第一张结果先拿软件。克隆仓库务必带子模块git clone --recursive https://gitcode.com/GitHub_Trending/ko/kohya_ss装依赖并起界面Windows 双击gui-uv.batLinux 与 macOS 执行./gui.sh。脚本会引导装 uv 环境、拉依赖、起服务最后浏览器打开 Gradio 界面。多平台差异一张表带过场景推荐方式说明本地 NVIDIA 显卡uv首选或pipWindows 跑gui-uv.batLinux/Mac 跑./gui.sh无独显 / 不想折腾Colab / Runpod / Novita浏览器直接跑免本地安装开发者 / 运维Docker容器化部署本地 Windows 用户提前装好 Python 3.11.9、CUDA 12.8 和一块 NVIDIA 显卡Linux 用 uv 最省事。两个最高频的环境错误提示No module called tkinter重装 Python安装时带上 tcl/tk 组件。Windows 报 page file 相关错误到系统设置里调大页面文件虚拟内存上限。素材这样组织——每张图旁边放一个同名的.txt描述文件按对象分子文件夹存放dataset/ └── 10_my_character/ ├── 01.png ├── 01.png.txt ├── 02.png └── 02.png.txt拿到第一个结果在 LoRA 标签页选基础模型、指向数据集文件夹、填几个默认参数点启动。训练中途用 sample prompts 字段让模型每隔若干步出一张测试图直观看到它在往哪个方向学。调参的先后顺序4 个最该动的参数新手最常见的错误是一上来满屏改数字。正确顺序是先定模型看得清不清再定学得稳不稳最后才碰强度。下面 4 个参数各给作用、感受和范围。1. Max resolution最大分辨率作用决定训练图被缩到多大再进模型。感受设太低细节糊设太高显存吃紧、还容易只记住局部。范围SD1.5 用512,512就够SDXL 至少1024,1024。它决定后面所有参数该往哪调所以先定它。2. Network Rank维度作用那几张便签能写多少字。rank 越大能存的信息越多但越容易把无关细节也记进去文件也更大。感受太小学不满画风学一半太大容易过拟合到某几张图。范围先试8默认值不够再升到16或32最多别超过128。3. Learning rate学习率 优化器作用每一步改多少。感受太大一步到位变成脸崩太小跑完几乎没变化。这里有个强绑定——不同基础模型的学习率量级差很多。SDXL 标准是 Adafactor 优化器配4e-7SD1.5 用 AdamW8bit 配1e-4默认值即可。Text encoder 的学习率默认5e-5通常比 U-Net 低一档别单独抬高它。4. Epoch训练轮数作用整套图反复学几遍。感受轮数越多越记住过拟合风险也越大。范围LoRA 一般2–3轮就够单张图反复练时用1轮加多次重采样反而更稳。一套可直接照抄的默认组合SDXL、AdafactorMax resolution1024,1024Network rank8Network alpha 与 rank 相同优化器adafactor配scale_parameterFalse, relative_stepFalse, warmup_initFalse学习率4e-7Text encoder 学习率5e-5LR schedulerconstant_with_warmupwarmup 约100步Epoch2batch size 按显存设12GB 可试 1–2显存参考SDXL 训 LoRA 建议显卡至少 12GB只有 6GB 时把 batch size 压到 1、开 fp16 混合精度勉强能跑但别指望大批量。两套实战单角色 LoRA 和画风 LoRA两个场景参数思路完全不同对照着改。单角色 LoRA十几张同一角色图问题只有 10–20 张图怕模型死记硬背某一张换个姿势就崩。判断依据图少 → 需要更保守的学习率 更强的防过拟合手段dropout、augmentation。关键参数学习率压到默认的一半左右rank 先给8开flip augmentation水平翻转帮它学对称角度rate of caption dropout给 5–10%逼模型学特征而非背词每张图配角色触发词 描述触发词固定放句首。预期效果触发词一出现角色的脸、发型、标志特征稳定出现换背景换姿势不再乱。画风 LoRA几十张同一风格图问题图多40要学的是气质而非某个具体对象最怕把某张图的构图也一起学了。判断依据图多 → 学习率可稍高、epoch 少一点重点靠 caption 做只学风格不学内容的引导。关键参数图多可上 batch size 2–4 提速学习率相应上调caption 写风格词 通用描述刻意不写具体主体开shuffle caption打乱词序避免某个词和某张图绑定想连卷积块一起学可把 LoRA 类型从 Standard 换成 LoCon 或开 conv。预期效果套上这个 LoRA任何提示词都带统一色调和笔触但主体还是你提示词里写的那个。避坑手册显存不足、过拟合与出图跑偏常见问题错误做法正确解法显存爆掉 / 训练卡死直接调大分辨率和 batch size先降 max resolution、batch size 设 1、开 fp16仍不行再开 gradient checkpointing 或 memory efficient attention出图脸崩、过拟合学习率太高、epoch 太多学习率减半、epoch 收到 2加 caption dropout必要时用 Stop text encoder training 在中段停掉文本编码器触发词没反应 / 学不到全数据集共用同一个 caption每张图单独配 .txt触发词固定放句首其余写差异描述不同比例图报错关 buckets 后塞一堆不同比例图保持Enable buckets默认开不同比例图会被自动分桶增强不生效同时勾 cache latents 和 color augmentationcache latents 与多数增强互斥要增强就关 cache或只留 flip_aug远程/SSH 训练卡在弹框用默认方式连远程加--headless启动跳过本地文件选择与是否覆盖弹框进阶提醒出图效果不好时先确认是数据问题还是参数问题——图不清晰、caption 写错、触发词不一致这三样能解释掉大半玄学现象改参数之前先排它们。进阶与生态presets、日志监控与多卡不想每次从零填参数可以直接用仓库自带的 presets。presets/lora/下有大量现成配置Adafactor、LoHA、LoKR、不同学习率的 SDXL 方案presets/dreambooth/与presets/finetune/对应另外两种训练界面里选一个加载比手写命令稳得多自定义组合也能存成模板复用。训练过程要盯着看别盲训。默认用 TensorBoard 记录 loss 曲线一路平滑下降是好信号突然跳水或抖动要警惕过拟合想要云端协作式可视化可填 WandB API Key 走 WandB。硬件与远程单卡 12GB 起步能覆盖 SDXL LoRA多卡可在 Accelerate 标签页指定 GPU IDLinux 上用--server_port起多个实例、配 tmux/screen 各占一个端口来并行。更完整的选项速查见 docs/LoRA/options.md 与 docs/LoRA/top_level.md安装细节在 docs/Installation/ 目录uv/pip 四套路径默认值可写进根目录的config example.toml复制成config.toml即自动生效。收尾今天就能做的第一步挑 10–15 张最清晰的同一对象图配好触发词 描述的 caption用上面的默认组合跑一次 2 轮 LoRA训练中途开 sample prompts 每 200 步出一张图先看方向对不对再回来调 rank 和学习率。数据决定下限参数决定上限——先把图备干净比任何调参技巧都管用。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表