ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

用10分钟语音数据训练AI变声模型:RVC完整上手指南

用10分钟语音数据训练AI变声模型:RVC完整上手指南 用10分钟语音数据训练AI变声模型RVC完整上手指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下文简称 RVC是一个基于 VITS 的开源变声Voice Conversion框架。它的核心机制是用 top1 检索把输入源特征替换成训练集特征从而杜绝音色泄漏底模由接近 50 小时的开源 VCTK 数据集训练无版权问题。你只需要 10 分钟左右的低底噪语音就能在普通显卡上训出一个可用的变声模型。它替你解决了什么问题10 分钟数据就够开训官方建议训练集时长为 10~50 分钟音质高、底噪低且音色有特色时5~10 分钟也能出效果。1~2 分钟的数据偶尔有人成功但不可复现1 分钟以下不建议尝试。检索替换掐断音色泄漏RVC 推理时用 top1 检索把输入源的音色特征替换为训练集特征变声结果贴近目标音色而不是被源音频带偏。配合 ckpt-merge 选项卡你还可以做模型融合进一步调整音色。旧显卡也能跑官方明确提到即便在相对较差的显卡上也能快速训练4G 显存的卡尚且可用4G 以下基本只能放弃。预处理工具链内置界面里可直接调用 UVR5 模型分离人声和伴奏用于清理训练素材音高提取采用 InterSpeech2023-RMVPE 算法解决哑音问题比 crepe_full 更快、资源占用更小并且支持 A 卡/I 卡加速。上手路线图7 步准备 Python 3.8 环境安装 PyTorch 及核心依赖按显卡类型安装对应依赖清单补齐assets目录下的预模型安装 ffmpeg下载 RMVPE 音高提取模型rmvpe.pt运行python infer-web.py启动 WebUI在网页中完成训练、索引、推理主流程装环境、备资源、启动第一步装 Python 与 PyTorch所有指令都要求 Python 大于 3.8。先装 PyTorch 三件套已装可跳过具体版本选择参考 PyTorch 官方安装页pip install torch torchvision torchaudioWindows Nvidia Ampere 架构RTX30xx用户按经验需要锁定 CUDA 版本pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117第二步按显卡选依赖清单你的硬件环境执行命令N 卡Nvidiapip install -r requirements.txtA 卡/I 卡DirectMLpip install -r requirements-dml.txtA 卡 ROCm仅 Linuxpip install -r requirements-amd.txtI 卡 IPEX仅 Linuxpip install -r requirements-ipex.txt如果你偏好用 Poetry 管理依赖注意 python 建议选 3.7~3.10其他版本在安装llvmlite0.39.0时会冲突poetry init -n poetry env use path to your python.exe poetry run pip install -r requirements.txt第三步补齐预模型RVC 推理和训练依赖一组预模型完整清单如下缺哪些补哪些./assets/hubert/hubert_base.pt./assets/pretrainedG/D 系列.pth底模v1./assets/uvr5_weights人声分离权重./assets/pretrained_v2可选想用 v2 底模才需要rmvpe.pt放到仓库根目录A 卡/I 卡用户可选再下rmvpe.onnx模型从项目配套的 Hugging Face 模型仓库获取仓库里也附带了下载脚本tools目录下有download_models.pyPython 版和dlmodels.shshell 版依赖 aria2跑一个即可。第四步装 ffmpegffmpeg/ffprobe 已装可跳过Ubuntu/Debiansudo apt install ffmpegMacOSbrew install ffmpegWindows从项目配套模型仓库下载ffmpeg.exe和ffprobe.exe放到仓库根目录第五步启动python infer-web.py若依赖是用 Poetry 装的则poetry run python infer-web.py分支路线各取最短路径整合包下载解压RVC-beta.7z。Windows 双击go-web.batMacOS 执行sh ./run.sh。MacOS 全新环境直接sh ./run.sh脚本会自动装 Python 3.8、建 venv、补依赖并调起infer-web.py。I 卡 IPEXLinux启动前先执行source /opt/intel/oneapi/setvars.sh。AMD ROCmLinux先装驱动Arch 用户可用pacman -S rocm-hip-sdk rocm-opencl-sdk。部分显卡型号如 RX6700XT还需export ROCM_PATH/opt/rocm和export HSA_OVERRIDE_GFX_VERSION10.3.0并确保当前用户在render、video组内sudo usermod -aG render $USERNAME、sudo usermod -aG video $USERNAME。避坑指南常见故障排障清单现象报 ffmpeg error 或 utf8 error原因大概率不是 ffmpeg 本身的问题。路径里带空格、括号等符号会触发 ffmpeg error训练集是中文路径时写入 filelist.txt 会触发 utf8 error。 处理把素材目录改成纯英文、无空格的路径。现象一键训练结束没有 added 开头的索引文件原因训练集过大时添加索引这一步会被卡住。注意只要出现过 Training is done. The program is closed. 就代表模型训练本身是成功的紧随其后的报错是假象。 处理重新点一次「训练索引」按钮。现象训练完成推理界面看不到新训练的音色原因音色列表未刷新或训练过程实际有报错。 处理先点刷新音色仍没有的话把控制台输出、WebUI 截图以及logs/实验名下的日志整理出来反馈给开发者。现象Connection Error原因你把控制台黑色命令行窗口关掉了。 处理保持控制台窗口开着。现象WebUI 弹出 Expecting value: line 1 column 1 (char 0)原因局域网代理或全局代理处于开启状态客户端、服务端如学术加速设置的 http_proxy/https_proxy都要关。 处理关闭代理后重试。现象CUDA error / out of memory原因小概率是设备不支持大概率是显存不足。 处理训练时把 batch size 调小调到 1 仍不够只能换卡推理时酌情调小 config.py 末尾的x_pad、x_query、x_center、x_max。4G 以下显存的卡建议直接放弃。现象Windows 报Could not load shared object file: llvmlite.dll原因缺少 VC 运行库。 处理安装微软 VC 2015-2022 redistributable 后重启 WebUI。现象RuntimeError: The expanded size of the tensor (17280) must match ...原因wavs16k里混进了体积异常小的坏音频文件。 处理找出并删掉这些文件重新点训练模型注意一键流程已中断训完记得再补一次索引。现象中途换采样率后训练报错原因不同采样率对应的中间特征不能混用。 处理更换实验名从头训练也可以把上次提取好的音高和特征0/1/2/2b 文件夹拷过去加速。调参参考训练集底噪大时 total_epoch 给 20~30 即可音质高、时长足可以给到 200。分享模型时给的是weights目录下 60MB 的.pth加对应的 index 文件而不是logs里几百 MB 的实验状态文件。更多细节见 docs/cn/faq.md。写在最后RVC 把「少量数据、低配显卡、网页操作」三件事同时做到了是目前个人玩家门槛最低的 VITS 变声训练框架之一。预模型备齐后你的下一步就是准备 10 分钟以上的干净人声素材启动 WebUI 跑通第一个实验再根据试听结果调整 index rate 和 total_epoch。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表