
三步从录音到变声RVC 语音转换工具部署快速上手【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI做声音转换的门槛其实比大多数人想的低录上 10 分钟一段低底噪的语音RVCRetrieval-based Voice Conversion WebUI就能据此训练出一个可用的音色模型。这个基于 VITS 的框架把预处理、训练、推理都收进一个网页界面里既能批处理转音频也支持实时变声——端到端延迟 170ms换用 ASIO 声卡可压到 90ms。下面带你把环境从 0 搭到页面跑起来。RVC 能做什么你的机器够不够格先对齐预期再动手装10 分钟低噪语音即可训出效果不错的模型中端显卡训练速度可接受网页界面覆盖全流程不需要背命令行参数内置 UVR5 模型一键把人声和伴奏拆开不是只有 N 卡能跑A 卡、I 卡均有对应加速方案硬件底线大致是 4G 显存的 N 卡起步3G 基本无望。底模由近 50 小时的开源 VCTK 数据集训练版权上没有顾虑。许可证见 LICENSE细节更多的问题可先翻 docs/cn/faq.md。第一步拿到代码按显卡选装依赖先把仓库克隆下来git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIPython 需要 3.8 以上。之后的路线取决于你的系统和显卡。Windows先装 PyTorch再选依赖文件pip install torch torchvision torchaudio pip install -r requirements.txt # N 卡走这里显卡是 RTX30xxAmpere 架构的话装 PyTorch 时要指定 cu117 源否则容易装到不匹配的版本pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu117A 卡或 I 卡用户把依赖文件换成requirements-dml.txt。不想折腾环境的直接解压整合包RVC-beta.7z双击go-web.bat就是 WebUI双击go-realtime-gui.bat是实时变声界面。Linux三种显卡三套依赖PyTorch 照常用 pip 装完剩下的按卡型挑一条N 卡pip install -r requirements.txtA 卡ROCmpip install -r requirements-amd.txtI 卡IPEXpip install -r requirements-ipex.txtROCm 路线在 Arch 上可以用pacman -S rocm-hip-sdk rocm-opencl-sdk装驱动RX6700XT 一类显卡需要额外导出HSA_OVERRIDE_GFX_VERSION10.3.0与ROCM_PATH/opt/rocm并把当前用户加入render、video组。IPEX 用户启动前记得先执行source /opt/intel/oneapi/setvars.sh。macOS一条脚本全包sh ./run.sh它会自己建好 Python 3.8 虚拟环境、补齐依赖、拉取模型文件最后直接帮你把 WebUI 启动是最省事的一条路。第二步模型文件与 ffmpeg 就位RVC 离不开几个预训练模型完整清单写在 tools/download_models.py 里跑一遍即可全部下载./assets/hubert/hubert_base.pt./assets/pretrainedv1 底模./assets/uvr5_weights人声/伴奏分离./assets/pretrained_v2要用 v2 版本才需要ffmpeg 负责音频的读取与切分缺了它后面全卡住sudo apt install ffmpeg # Ubuntu/Debian brew install ffmpeg # macOSWindows 用户把ffmpeg.exe和ffprobe.exe放进项目根目录即可。音高提取默认用 RMVPE 算法把rmvpe.pt放到项目根目录A 卡/I 卡用户可另选下载rmvpe.onnx。第三步启动并确认跑通python infer-web.py如果之前用 Poetry 装依赖则换成poetry run python infer-web.py。浏览器打开后能看到人声/伴奏分离、训练、推理等选项卡且页面不报错就说明部署完成。想体验实时变声Windows 双击go-realtime-gui.bat其余系统跑python gui_v1.py。高频坑位速查 报 ffmpeg error 或 utf8 error九成是路径问题音频路径里的空格、括号或中文都会触发把文件挪到纯英文短路径再试。Cuda out of memory训练时缩小 batch size推理时调小 configs/config.py 结尾的 x_pad、x_query、x_center、x_max 四个值。网页突然 Connection Error多半是后台那个黑色控制台窗口被关掉了页面存活期间终端不能退。训练结束却看不到索引文件打印 Training is done 之后的报错是假的手动再点一次训练索引通常就能补上。想分享模型分享的是weights文件夹下 60MB 的 pth 文件不是logs实验目录里那个大文件。下一步更多调参思路可以翻 docs/cn/Changelog_CN.md 了解版本变化。现在就去录一段 10 分钟、底噪尽量低的干声丢进训练选项卡跑通你的第一个模型。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考