ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RVC 语音克隆完整教程:用 10 分钟录音做出第一个 AI 变声模型

RVC 语音克隆完整教程:用 10 分钟录音做出第一个 AI 变声模型 RVC 语音克隆完整教程用 10 分钟录音做出第一个 AI 变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI按本文走完全部操作你能用目标人 10 分钟的说话录音训练出一个 RVC 语音克隆模型RVC 全名 Retrieval-based Voice Conversion WebUI检索式语音转换框架之后把任意音频转换成这个人的音色。它基于 VITS 语音合成框架数据门槛低、对显卡要求宽松是新手做 AI 变声的起步首选。RVC 环境自查清单四步启动 WebUI这一节解决我的电脑能不能跑起来。把下面 5 项逐条过一遍全部满足再动手能省掉一半的报错排查时间。Python 版本 3.8 以上——依赖用 pip 装版本过低装不上。显卡匹配一份依赖文件N 卡走requirements.txtA 卡 Windows 走requirements-dml.txtDirectML 加速A 卡 Linux 走requirements-amd.txt需先装 ROCm 驱动I 卡 Linux 走requirements-ipex.txtIPEX 加速。选错文件是安装阶段最常见的坑。ffmpeg 和 ffprobe 可用——Linux 用包管理器装macOS 用 brew 装Windows 用户把两个 exe 放进项目根目录即可。预训练模型齐全——assets/hubert、assets/pretrained、assets/uvr5_weights是必选项想用 v2 版本再加assets/pretrained_v2。不用手动找仓库自带的 tools/download_models.py 一条命令批量下载。显存预期4G 以上显存可以训练4G 以下基本只能做推理建议直接用云端算力训练。自查通过后执行N 卡示例其他显卡换对应依赖文件git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt python tools/download_models.py然后启动python infer-web.py浏览器打开http://localhost:7865看到界面即成功端口被占用就加参数换端口python infer-web.py --port 7861。⚠️ 运行期间黑色控制台窗口就是后端服务本体关掉它界面会直接 Connection Error需要重启。第一次 RVC 变声最短路径从 10 分钟录音到换好音色这一节只走最短成功路径每一步都最少必要参数为什么这么设放在步骤跑通之后统一讲。准备素材找目标人 10~30 分钟的录音导出为 WAV、单声道、44.1kHz去掉底噪和静音段全部放进dataset文件夹。质量远比数量重要同一个人、音色统一即可。开始训练「训练」标签页填一个实验名纯英文即可目标采样率选 40k点一键训练系统自动完成切分长音频 → 提取音高和特征 → 训练模型 → 训练索引。中途会持续产出logs/实验名下的G_xxx.pth生成器和D_xxx.pth判别器控制台出现 Training is done 即成功此时已生成added_xxx.index特征检索库推理时靠它把声音锁在目标音色上。做第一次变声「模型推理」标签页点刷新音色列表和索引路径在下拉框选中刚训好的模型输入待处理音频路径变调填 0F0 算法选rmvpeIndex Rate 填 0.6点转换几秒钟到几十秒后听到结果——第一次 RVC 变声完成。跑通之后再理解这几个参数改起来心里才有数参数人话解释建议值变调按半音升降调12 升八度-12 降八度男翻女主要靠它0 起步Index Rate越大越像训练集音色越小越自由但易混入原音音色泄漏清唱 0.7~0.8带伴奏 0.5~0.6F0 算法rmvpe效果最好、占用可控首选harvest低音好但慢pm最快rmvpetotal_epoch训练轮数音质差底噪大 20~30 就够音质高素材多可上到 200按数据质量定采样率32k 适合实时变声和语音助手40k 适合音乐配音48k 音质最好但更吃硬件40k训练中途绝对不能换采样率否则报 tensor 尺寸不匹配只能换新实验名从头来。想中断训练时直接关控制台再启动用相同参数点训练会从上次检查点续训不会白练。RVC 调参与报错快速对照声音不像或报错怎么办这一节解决两件事结果不满意往哪调以及报错对号入座。效果排查顺序先数据再参数最后采样率。训练集有底噪、爆音、背景人声或素材不是同一人统一音色效果上限就锁死了——这比加训练轮数有效得多。数据没问题的话把 Index Rate 从 0.5 到 0.9 每次加 0.1 逐步试找最顺耳的值如果训练集本身优质且时长足模型就不容易跑偏Index Rate 甚至可以不纠结。报错三行式对照症状 → 原因 → 处理症状ffmpeg error / utf8 error原因不是 ffmpeg 坏了是音频路径带空格、括号或中文处理音频改名、挪到纯英文路径症状WebUI 弹出 Expecting value 解析错误原因系统全局/局域网代理干扰了 JSON 解析处理关闭代理服务器端的 http_proxy 也要 unset然后重启 WebUI症状llvmlite.dll 缺失Windows 常见原因缺 Visual C 运行库处理安装 vc_redist 运行库后重启电脑症状CUDA out of memory原因显存不够处理训练侧把 batch size 调小最低 1推理侧把 configs/config.py 末尾的x_pad、x_query、x_center、x_max酌情调小。4G 以下显存直接放弃训练症状tensor 尺寸不匹配原因wavs16k目录里有异常偏小的音频文件或中途改了采样率继续训练处理删掉异常文件重新训练若是改过采样率换新实验名从头来症状训练完成但没生成added_开头的索引原因训练集太大添加索引步骤卡住处理手动再点一次「训练索引」症状推理列表里没有新模型原因没刷新或训练过程中断处理点「刷新音色列表和索引路径」还没有就查logs/实验名下的日志 如果报 Memory error内存而非显存多半是 CPU 进程开太多把「提取音高和处理数据使用的 CPU 进程数」拉低并把训练音频手工切短。进阶玩法原始音频带伴奏时先用内置 UVR5 把纯人声分离出来再训练效果明显更干净想要混合音色可用「ckpt 处理」标签页的模型融合ckpt-merge把两个模型按权重合成一个。分享模型时注意logs/实验名下几百 MB 的 pth 是训练存档不能直接分享——先在「ckpt 处理」标签页底部用「小模型提取」转成weights目录下 60MB 的轻量 pth再连同added_xxx.index一起打包发出去。RVC 模型完成后下一步三件事用最短素材闭环一次找 10 分钟录音完整走一遍训练 推理建立对每个环节时长的手感把数据做到 30~50 分钟重训total_epoch 上调到 100 左右Index Rate 从 0.5 到 0.9 以 0.1 为步长扫一遍锁定最贴的音色尝试进阶功能用 UVR5 分离人声重训再用模型融合把两个模型合成一个感受音色的可控调整。延伸资料更细的问答看 docs/cn/faq.md索引训练与模型提取的脚本在 tools/infer/。真正拉开 RVC 语音克隆效果差距的从来不是参数玄学而是训练数据够不够干净、音色够不够统一——数据干净了剩下的只是重复点按钮。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表