
10分钟语音训练AI变声模型RVC实战指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想给自己录的游戏角色配音或者把一段念白换成另一个人的音色传统做法是找配音演员或买商业引擎。Retrieval-based-Voice-Conversion-WebUI下称 RVC把这件事压缩到一条命令丢给它 10 分钟干净人声几小时后你就拿到一个能实时换音色的模型。它是基于 VITS 的变声框架主打数据少也能出好效果而且自带网页界面和实时变声端。 它凭什么用 10 分钟数据就 workRVC 的关键词在名字里Retrieval检索。传统 TTS/VC 直接把源语音特征喂给模型容易把原始音色一起带过去产生音色泄漏——换完声还能听出原声的影子。RVC 的做法是先建一张检索表推理时把输入特征换成训练集里最接近的特征再合成。类比一下普通做法是照着你的照片画肖像画师难免带上你的脸RVC 是先查一下目标画师画过的人里谁跟你表情最像直接拿那张参考来画。源音色被替换掉了只保留内容和语气。具体实现在 infer/lib/rtrvc.py输入先过 HuBERT 提取 256 维特征然后用 faiss 近似最近邻搜索index.search(npy, k8)按距离倒数加权最后和原特征按比例混合feats feats * index_rate (1 - index_rate) * feats这个index_rate就是控制换声力度的旋钮默认 0.66。值越大越贴目标音色越小越保留源语音的韵律细节。检索表本身是用 faiss 的IVF512,Flat索引训练的训练代码在 tools/infer/train-index.py调参思路可看 docs/en/faiss_tips_en.md。 从 clone 到出声音的最短路径1. 装环境Python 3.8git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt # N卡A卡/I卡换 requirements-dml.txt2. 拉预训练模型 ffmpegpython tools/download_models.py sudo apt install ffmpeg # macOS 用 brew install ffmpegdownload_models.py会把 HuBERT、RMVPE、v1/v2 预训练权重、UVR5 全部下到assets/对应目录不用手挑。3. 启动python infer-web.py # 默认端口 7865浏览器打开即用Windows 用户直接双击 go-web.bat实时变声端是 go-realtime-gui.bat。训练产物统一落在logs/你的实验名/网页界面里点一键训练会依次走完预处理切句 → 提音高 HuBERT 特征 → 训练 → 训练检索索引。 RVC 和常规方案差在哪维度RVC从零训练 VITS商业 VC 引擎数据量≥10 分钟数小时起数小时起音色泄漏检索机制从源头规避明显依产品而定实时变声内置170ms 端到端需自研有本地免费是MIT是多数收费公平地说RVC 的底模是用约 50 小时 VCTK 公开语料训出来的无版权顾虑所以它省的是你的数据量不是它的数据量。想从零训 VITS 也不是不行只是门槛高得多。⚠️ 踩过的坑直接给结论显存小就自动降级configs/config.py 会按显卡自动切 fp32 并调小x_max老卡1060~1080 系列强制单精度。看到日志打印 force to fp32 是正常行为不是报错别去改它。音高提取选 RMVPE实时/批量换声时 f0 算法优先用 RMVPEInterSpeech 2023 方案比 crepe_full 快、占资源少还根治哑音。它需要根目录下的rmvpe.ptdownload_models.py已包含。CLI 场景--f0method只支持harvest/pm两种见 tools/infer_cli.py。检索表别用错文件推理时 faiss 会校验索引若用了trained_*.index而不是added_*.index会直接报 Invalid index。GUI 里训练特征索引按钮产出的就是能用的那份。换声太像原声 / 太像模板往大了调index_rate提相似度往小了调保韵律批量脚本里对应--index_rate--protect默认 0.33保护气声等细节别盲目拉满。数据本身要干净至少 10 分钟、低底噪、同一设备录的混音效果最好。切句默认按 4 秒一段、0.3 秒重叠、再降采样到 16k底噪大的数据预处理救不回来源头降噪比后面调参有用。 周边工具链人声/伴奏分离内置 UVR5infer/modules/uvr5/权重在assets/uvr5_weights/批量 CLI 换声tools/infer_cli.py、tools/infer_batch_rvc.py模型融合infer/lib/train/process_ckpt.py网页ckpt-merge页签可混两个音色ONNX 导出部署tools/export_onnx.py、tools/onnx_inference_demo.py多语言界面i18n/locale/ 覆盖中、英、日、韩等 12 种语言➡️ 接下来动手拉一个 ≥10 分钟干净人声文件夹在网页训练页填实验名后点一键训练先跑通一次完整流程。拿同一批数据用index_rate0.5 / 0.66 / 0.8 各转一遍耳朵选一个折中值这是最直接的调参方式。要实时场景就上 go-realtime-gui.batWindows 用 ASIO 设备可把端到端延迟压到 90ms。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考