
kohya_ss 在 AMD 显卡上 3 步跑通 AI 绘画模型训练ROCm 实操手册【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss想在 RX 7900 XTX 上花两小时练出一个 LoRAkokya_ss 拼写是 kohya_ss——一套支持 LoRA、DreamBooth 与全量训练的 AI 绘画模型训练工具配合 ROCm 技术栈可以直接跑在 AMD 显卡上无需 NVIDIA 硬件。环境速查项目推荐配置操作系统Ubuntu 22.04 / 24.04 LTSROCm 版本6.3对应 torch 2.7.1rocm6.3Python 版本3.11最低显存12 GBSDXL LoRA 官方建议sudo apt update sudo apt install -y rocm-hip-sdk git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss pip install -r requirements_linux_rocm.txt python -c import torch; print(torch.__version__, torch.cuda.is_available())requirements_linux_rocm.txt固定了 PyTorch ROCm 版、tensorflow-rocm 与 onnxruntime-rocm 的版本最后一行命令输出2.7.1rocm6.3 True即环境就绪。能力全景训练模式矩阵训练模式数据量典型耗时产物大小LoRA10~50 张1~2 小时10~100 MBLoConLoRA 变体10~50 张1~2 小时10~100 MBDreamBooth20~100 张3~5 小时2~7 GB完整模型全量训练数百~数千张8 小时以上2~7 GB完整模型可视化操作台kohya_gui/ 下的 Gradio 界面替代了全部命令行操作LoRA、DreamBooth、全量微调、Textual Inversion 各有独立标签页分辨率、batch_size、优化器、学习率全部以表单呈现。本地启动用./gui.sh --use-rocm远程 SSH 场景追加--headless --listen 0.0.0.0。数据与预设工具箱数据处理脚本位于 tools/caption.py按文件名规则批量生成 caption 文本文件group_images.py把相似比例的图片分组到子目录convert_images_to_webp.py将图片转为 webp 压缩体积。presets/ 里收录了社区验证过的训练配置 JSON如 SDXL - LoRA AI_characters standard v1.1test/ 内置一套 8 张 512×512 的示例图片和dataset.toml配置模板可直接用于验证环境。完整实操一次 LoRA 训练走通全流程第一步数据准备准备 10~50 张目标风格图片512×512 起步逐张配同名 .txt 描述文件先用 test/ 目录的小数据集验证流程python tools/caption.py test/img/10_darius\ kawasaki\ person --caption_text a person即可生成 caption第二步参数配置batch_size 起点RX 7900 XTX24 GB从 2 开始试跑通后再上调16 GB 卡从 1 开始FP16 开关SDXL 勾选 full_fp16显存占用明显下降若出现 NaN 或异常退回 fp16 模式梯度检查点显存吃紧时在 advanced 选项开启牺牲约 20% 速度换 30%~50% 显存rank 设 8~32learning_rate 参考 1e-4SD1.5或 4e-7SDXLepoch 按数据集大小调到 10~30第三步启动训练在 GUI 的 LoRA 标签页选择底模、填入数据集路径点 Start 即可或在命令行启动带 ROCm 环境的界面./gui.sh --use-rocm第四步检查产出训练完成后在输出目录找到*_epoch-N.safetensors文件体积通常在几十 MB观察 TensorBoard 的 loss 曲线是否平稳下降用产出的 LoRA 在生图端加载验证风格命中性能与显存调优显存溢出OOM→ batch_size 减半并开启梯度检查点FP16 混合精度→ 显存占用约降 30%~50%、速度小幅提升代价是极少数情况下数值不稳定需留意 loss 异常数据加载 IO 慢→ 数据集放 SSD开启cache_latents预计算 latentsworker 数不超过 CPU 物理核心数训练速度慢→ 用rocm-smi确认 GPU 利用率排除数据加载瓶颈多卡场景→ 结合梯度累积gradient_accumulation_steps模拟大 batch而非盲目堆 batch_size显卡型号推荐 batch_size 起点RX 7900 XTX24 GB2可试 4RX 7800 XT16 GB1RX 7600 XT8 GB1建议 512 分辨率 检查点踩坑速查hipErrorNoBinaryForGpuPyTorch 预编译核不支持你的 GPU 架构。rocminfo确认显卡被识别 →sudo apt install --only-upgrade rocm-hip-sdkHIP out of memory/ OOM显存溢出降低 batch_size 并开启梯度检查点。 GUI 中将 Train batch size 改为 1 → 勾选 gradient_checkpointing 后重跑TensorFlow 导入报版本冲突ROCm 版 TF 与 CPU 版 TF 混装所致。pip uninstall tensorflow tensorflow-rocm→pip install tensorflow-rocmGPU 利用率低、训练异常慢多为数据加载或驱动问题。rocm-smi监控利用率 →rocminfo | grep -i gfx确认架构与 torch 编译目标匹配下一步行动清单用 test/ 的小数据集 test/config/dataset.toml跑通一次 LoRA 训练把本次训练的 rank、learning_rate、batch_size、epoch 记入文档作为下次基线跑通后换成自己的数据集分辨率从 512 起步参考 docs/ 的 LoRA 章节与安装文档跟进项目更新从今天的 8 张小图开始先跑通再谈调优。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考