
kohya_ss 在 AMD 显卡上跑通 AI 模型训练一份完整配置指南【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss在 AMD 卡上训 LoRA 翻车多数时候栽在 PyTorch 装错了版本而不是软件本身ROCm 官方源直接装很容易和驱动对不上报出torch.cuda.is_available() False或 HIP 库缺失。kohya_ss 的 AMD 训练路线比通用流程多一道硬前提——ROCm 版本必须和 wheel 严格对齐项目里锁好版本的 ROCm 依赖文件替你做完了这个匹配。一句话说清它是什么kohya_ss 是一个基于 Gradio 的图形界面把扩散模型的 LoRA 微调、DreamBooth、文本反转这些活儿做成了表单操作不用手写训练脚本。它适合 AMD 用户的原因很具体仓库自带 requirements_linux_rocm.txt锁死torch 2.7.1rocm6.3、tensorflow-rocm等版本启动脚本 gui.sh 检测到 ROCm 环境后会自动切到这份文件不用手动挑依赖。装对环境 装前自检清单系统LinuxUbuntu 20.04 / 22.04 LTS 最省心显卡RX 6000 / 7000 系列验证得最多Python3.10 或 3.11项目要求3.10,3.12ROCm 驱动6.3 及以上rocminfo能输出显卡信息磁盘10GB 以上可用空间sudo apt update sudo apt install rocm-hip-sdk预期结果终端里敲rocm-smi能看到你的显卡型号和显存读数说明驱动层就绪。依赖安装git clone https://link.gitcode.com/i/d7378218bf3f2ea64797ad456dbd09b4 cd kohya_ss预期结果本地多出一个kohya_ss目录里面能看到gui.sh和各份 requirements 文件。pip install -r requirements_linux_rocm.txt预期结果装完没有版本冲突报错。这份文件从download.pytorch.org/whl/rocm6.3取 torch并追加-r requirements.txt把其余依赖拉齐。注意别先装通用版或 CUDA 版 torch后面再装 ROCm 文件两者会打架。启动验证bash gui.sh预期结果终端打印 ROCm 检测日志浏览器弹出 Gradio 界面本地地址可直接访问——到这里配置就算通了。WSL2 环境下如果脚本提示LD_LIBRARY_PATH未设置按提示执行export LD_LIBRARY_PATH/usr/lib/wsl/lib/再重启即可。场景→入口对照表 ️训练数据按 test/img/ 的结构组织即可每个子文件夹放一组图支持.png、.jpg、.jpeg、.webp、.bmp每张图配一个同名.txt写标注。你想做的事去哪个入口给模型加画风、加角色LoRA 训练标签页生成某个特定人物/物体的专属模型DreamBooth 标签页造新提示词概念不训完整权重文本反转标签页用 SDXL 底模各训练页选 SDXL参数面板单独调整只让模型学主体、忽略背景掩码损失配 mask 图使用掩码图是黑白二值图白色区域参与损失计算、黑色区域被忽略适合主体和背景都要区分对待的数据集。排坑手册 ️现象训练刚跑几步就 OOM进程被杀掉。原因batch 过大或没开省显存选项。动作降batch_sizeRX 7900 XTX 可以从 4 起步往下试开 FP16 混合精度再开梯度检查点。现象pip 报依赖冲突装到一半中断。原因Python 版本不在 3.10 / 3.11 范围内或之前装过 CUDA 版 torch 残留。动作确认python --version重开干净的虚拟环境只装 requirements_linux_rocm.txt不要再碰其他 torch 来源。现象rocm-smi不认卡或训练卡在设备初始化。原因驱动版本低于 6.3或内核模块没加载。动作跑rocminfo看驱动版本与 GPU 识别先修驱动再谈训练。现象多张 AMD 卡只有第一张在工作。原因没走 Accelerate 的分布式配置。动作在 GUI 的 Accelerate Launch 部分指定 GPU 编号和进程数多卡跑训练时保持混合精度开启。显存不够先开这 3 个开关 开关作用什么时候开FP16 混合精度显存占用大约减半常开精度损失通常可接受梯度检查点不缓存中间激活用重算换显存OOM 后第一个开它latent 预缓存数据集固定时把 latent 算一次后续直接读同一批数据反复训时开batch_size 没有标准答案按卡定16GB 显存从 2 起试24GB 从 4 起试训几步看rocm-smi的占用留 2~4GB 余量。资源与下一步 中文训练说明docs/train_README-zh.md数据准备和公共选项都写在这脚本示例examples/ 下有 LoRA、DreamBooth 的启动脚本可抄参数预设presets/ 里按 SD1.5 / SDXL 分好了 LoRA、DreamBooth 的成品参数配套工具tools/ 提供标注、模型转换、LoRA 提取等先按上面的清单把环境跑通、用test/img/的样例数据训出第一个 LoRA再谈调参。参数一次只改一个跑通的有效组合存一份到presets/lora/user_presets/下次直接复用。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考