ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

从 0 到 1 跑通 kohya_ss:AMD ROCm 训练环境实战手册

从 0 到 1 跑通 kohya_ss:AMD ROCm 训练环境实战手册 从 0 到 1 跑通 kohya_ssAMD ROCm 训练环境实战手册【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss在 AMD 显卡机器上配置 kohya_ss 训练环境最容易卡在 PyTorch 构建的选择上装错 CUDA 版 wheel环境就要推倒重来。项目官方提供了 ROCm 依赖通道本文按四个阶段把环境搭好并确认第一次训练能落地。kohya_ss 训练环境定位适用边界与硬性前置条件kohya_ss 是基于 Gradio 的扩散模型训练前端把底层训练脚本的优化器、学习率、分桶分辨率等参数封装成图形界面你不需要手写完整的训练命令行。它的边界也要说清项目面向训练侧不做模型下载与版本管理也不提供 WebUI 式的在线生图训练产物的评测需要配合其他工具完成。对 AMD 用户而言ROCm 在这里不是社区补丁而是与 CUDA 并列的官方安装路径安装脚本会根据rocminfo是否存在自动切换依赖清单你不用自己拼 wheel 索引地址。ROCm 依赖清单 requirements_linux_rocm.txt 中已锁定torch2.7.1rocm6.3与tensorflow-rocmPython 3.10 与 3.11 都有对应条目。开始之前确认三个硬性前置条件Linux 系统Ubuntu/Debian 系验证最充分ROCm 6.3 已安装且rocminfo可执行Python 3.10 或 3.11ROCm 清单未覆盖 3.12独立显卡显存 12GB 起SDXL 的 LoRA 训练是常见目标环境搭建与首次启动 ROCm 训练链路ROCm 运行时准备与验证GUI 里每个训练任务最终都跑在 PyTorch 的 HIP 后端上所以先确认系统层 ROCm 可用否则 Python 侧装再多包也没有意义。用发行版源装 ROCm 基础工具sudo apt update sudo apt install -y rocm-smi运行rocminfo应列出你的显卡与 gfx 架构rocm-smi能看到显存总量与占用。若输出里找不到 GPU先修驱动与内核模块不要继续下一阶段。拉取代码并安装 ROCm 依赖把仓库拉到本地后交给setup.sh创建 venv、安装依赖并写入 accelerate 配置它内部按平台选择依赖清单避免手动 pip 装错构建git clone https://gitcode.com/GitHub_Trending/ko/kohya_ss cd kohya_ssbash setup.sh --use-rocmROCm 分支下脚本会先升级 pipPyTorch ROCm 的 wheel 体积大旧版 pip 容易中断再按清单批量安装。正常结束会打印Setup finished! Run ./gui.sh to start.且项目根目录下已生成venv/。⚠️ 注意若机器同时装过 NVIDIA 驱动脚本可能优先命中 CUDA 分支。务必显式传--use-rocm装完后确认torch.version.hip非空否则拿到的是 CUDA 版 PyTorch。PyTorch ROCm 环境自检装完依赖做一次显式自检确认 Python 侧真正连上了 AMD GPU而不只是装了包source venv/bin/activate python -c import torch; print(torch.__version__, torch.cuda.is_available(), torch.version.hip)预期输出形如2.7.1rocm6.3 True 6.3.4版本带rocm后缀、可用性为True、HIP 版本号非空。三者缺一不可任何一项异常都说明构建选错回到上一阶段重装。首次启动 kohya_ss GUI 并定位训练页自检通过后直接启动启动脚本会激活 venv 并按平台复核依赖清单然后拉起主界面bash gui.sh浏览器打开启动日志中打印的本地地址默认 127.0.0.1:7860进入 LoRA 页确认模型路径与数据集目录可填写、Accelerate Launch 区域正常渲染即算跑通首链路。⚠️ 注意gui.sh会检查LD_LIBRARY_PATH未设置时打印黄色警告WSL2 环境下不补/usr/lib/wsl/lib/可能导致 HIP 运行库加载失败。核心能力速览LoRA、DreamBooth 与 masked lossLoRA 训练是 AMD 平台最常跑的入口。典型场景准备几十张同风格图片每张配同名.txt标注仓库示例 test/img/10_darius kawasaki person/ 就是这种图像标注成对结构。LoRA 页里把 network rank 设为 16、学习率落在 4e-7 量级SDXL 基准、最大分辨率给到 1024即可发起一次完整训练。DreamBoothfinetune面向单角色或单主体的全量微调参数在 finetune 页。它比 LoRA 更慢、显存占用更高适合主体需要高度还原且能接受完整权重产出的场景。⚠️ 注意SDXL 分辨率到 1024 后显存需求明显上升12GB 显存建议 batch 从 1 起步并开启 gradient checkpointing。masked loss是数据侧的进阶项给训练图配一张前景掩码黑白图白色为要学习的区域损失只在掩码内计算适合背景杂乱、只想提取主体特征的数据集。test/masked_loss/ 下存放了成对的掩码示例训练模式适用数据量显存压力产物LoRA10100 张低轻量 LoRA 权重DreamBooth20 张以上高完整 ckpt/safetensors加 masked loss视背景杂乱度与主模式相同同左收敛更聚焦主体参数不必全部手填配置模板 config example.toml 里train_data_dir、optimizer、gradient_checkpointing等字段带默认值与注释是可以照抄的对照底稿。排错与调优速查显存吃紧时按顺序处理先开 gradient checkpointing 换显存再把 batch 压到 1 配梯度累积最后才降分辨率多卡训练在 Accelerate Launch 区域设置gpu_ids与num_processes。问题现象可能原因排查命令或操作rocminfo列不出 GPUROCm 驱动或内核模块未装好运行rocm-smi查 dmesg 中 amdgpu 记录PyTorch 变成 CUDA 构建setup 未识别 ROCm 走了 CUDA 分支重跑bash setup.sh --use-rocm核对torch.version.hip训练中途 OOM分辨率或 batch 过高开 gradient checkpointing下调 max_resolutiongui.sh提示 venv 缺失跳过 setup 直接启动先完成bash setup.sh --use-rocmHIP 运行库加载失败LD_LIBRARY_PATH未设置按 gui.sh 警告补充后重启资源索引中文训练说明docs/train_README-zh.md界面字段与参数含义一一对应SDXL LoRA 基准配置docs/LoRA/top_level.md含优化器与学习率参考值现成训练预设presets/lora/ 下按场景整理好的参数 JSON数据集 TOML 示例test/config/ 覆盖多分辨率与 masked loss 写法到这里ROCm 环境从依赖到首个训练任务的链路都已落地后续工作集中在参数与数据集调优本身。【免费下载链接】kohya_ss项目地址: https://gitcode.com/GitHub_Trending/ko/kohya_ss创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表