
从环境到出图AMD显卡上用kohya_ss训练AI绘画模型的完整实操指南【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_sskohya_ss 是一套在 AMD显卡 上完成 AI绘画模型训练 的开源工具基于 ROCm 技术栈支持 LoRA 微调、DreamBooth 与 SDXL 完整训练并配有 Gradio 图形界面覆盖数据准备到模型产出的全过程。本文按装好环境 → 跑出第一个模型 → 处理数据 → 调优 → 排障的顺序带你把这条链路完整走一遍。装好ROCm训练环境4步让AMD显卡被PyTorch识别完成这一步后你的 Python 环境里会有一个能直接调用 AMD GPU 的 PyTorch后续所有训练命令都依赖它。先确认系统满足三个前提Ubuntu 20.04 / 22.04 LTSROCm 6.3 或更高版本Python 3.10 或 3.11然后按顺序执行# 1. 安装 ROCm 驱动组件 sudo apt update sudo apt install rocm-hip-sdk # 2. 获取 kohya_ss git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ss # 3. 安装 AMD 专用依赖torch 2.7.1rocm6.3、tensorflow-rocm、onnxruntime-rocm pip install -r requirements_linux_rocm.txt # 4. 验证版本正常输出且第二行为 True 即成功 python -c import torch; print(torch.__version__); print(torch.cuda.is_available())其中 requirements_linux_rocm.txt 指向 ROCm 6.3 的 PyTorch 官方索引装错普通 CUDA 版 torch 是后续大部分问题的根源验证命令的True就是最直接的确认信号。第一次跑通训练10张图片起步的最小配置做完这一步你将拥有第一个训练完成的模型文件和一批样本图并建立起对三种训练模式耗时、体积的预期。先用 test/img/ 里自带的小数据集试跑约 10-20 张 512x512 的图片即可不必等数据量充足才开始。三种训练方式的量级对比训练模式典型耗时模型体积适用情况完整模型训练8-12 小时2-7GB数据量大、全新风格DreamBooth3-5 小时2-4GB特定对象或人物LoRA 微调1-2 小时10-100MB少量数据、风格迁移启动界面python kohya_gui.py在 Gradio 界面中选择训练模式后新手建议这样起步以 RX 7900 XTX 为例其他显卡见下文参数建议值说明batch_size4按显卡型号调整fp16开启降低显存占用learning_rate0.0003可用区间 0.0001~0.0005rank4~16越大模型容量越大训练步数500~2000随数据量增减训练数据工具给图片补描述、分组和压缩这一步的产出是一个每张图有 caption 文件、按尺寸分好组、格式统一的干净数据集训练时不再因为缺描述或 IO 慢而卡住。仓库 tools/ 目录里可以直接用# 为目录内图片自动生成文本描述 python tools/caption.py --input_dir你的图片目录 # 按尺寸相似性把图片分组到不同文件夹 python tools/group_images.py --input_dir你的图片目录此外convert_images_to_webp.py、convert_images_to_hq_jpg.py负责批量格式转换crop_images_to_n_buckets.py负责裁切到分桶尺寸。kohya_gui/ 下还封装了图形化的分组、手动标注等入口不想敲命令可以从界面走。显存告急先调这3个参数batch_size、检查点、FP16做完这一步你会按自己的显卡型号得到一组能跑稳的参数组合而不是盲目试错。三个旋钮的作用batch_size最直接的控制项显存不够时优先降到 1 或 2。gradient_checkpointing牺牲约 20% 的训练速度换 30-50% 的显存节省适合高分辨率图或大模型。fp16 混合精度显存占用可接近减半对出图质量影响很小。按型号给的建议值显卡batch_size配套动作RX 7900 XTX4-8配合梯度检查点RX 7800 XT2-4开启 FP16RX 7700 XT1-2同时降低图片分辨率速度方面还有三个低成本动作训练前把图片全部预处理完数据集放在 SSD 上按 CPU 核心数设置数据加载 workers。四类高频故障症状对照排查每个问题都给出看到什么 → 做什么的对应关系。症状 1训练中途中断提示显存不足batch_size 降到 1 或 2开启 gradient_checkpointing分辨率从 512x512 降到 384x384拿 test/config/ 下的 dataset.toml 系列配置做参照修改症状 2启动即报 hipErrorNoBinaryForGpu升级 ROCm 到 6.3sudo apt upgrade rocm-hip-sdk运行rocminfo确认驱动与设备状态重启系统确保新驱动完全加载症状 3导入 TensorFlow 报版本兼容错误先确认 Python 版本与 requirements_linux_rocm.txt 的适配说明一致清理旧包pip uninstall tensorflow tensorflow-rocm重新执行pip install -r requirements_linux_rocm.txt症状 4GPU 利用率低、训练速度异常慢rocminfo | grep GPU确认 ROCm 是否识别到卡确认装的是rocm6.3后缀的 PyTorch而不是 CUDA 版训练时用rocm-smi实时观察显存与利用率进阶与扩展多卡、预设和内置监控多 GPU 训练在 GUI 中启用多卡选项把总 batch_size 分摊到每张卡显存吃紧时改用梯度累积用更小的单卡 batch 模拟更大的等效 batch。预设定制presets/ 里全是可直接启用的 JSON 参数集。新手从SDXL - LoRA AI_characters standard v1.0.json入手看默认项进阶后对照SDXL - LoRA kudou-reira prodigy v4.0.json理解优化器与学习率的配合再把自己的成功参数存成模板。训练监控kohya_ss 内置实时 Loss 曲线、每 N 步自动生成的样本预览以及显存使用情况训练中途即可判断参数是否合理。更多资料入口docs/ 收录分平台的安装与训练文档含 Linux/Windows 的 pip、uv 方案test/ 提供完整的示例图片与配置模板适合改完配置后快速回归验证。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考