ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

RVC 语音转换 WebUI 快速上手:用 10 分钟音频训练出你的 AI 声线

RVC 语音转换 WebUI 快速上手:用 10 分钟音频训练出你的 AI 声线 RVC 语音转换 WebUI 快速上手用 10 分钟音频训练出你的 AI 声线【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI假设你想让一段自己录的旁白听起来像某个歌手的唱腔或者想把一段清唱换成目标人物的音色。传统做法需要逐句修音、反复对比而 RVCRetrieval-based-Voice-Conversion-WebUI这件事交给它处理把 10 分钟左右的干净人声丢进去训练几分钟后就能对任意一段音频做整段的音色替换。整个过程在浏览器里点按钮完成不用写代码。 项目速览RVC 是一个基于 VITS一种端到端语音合成模型的开源变声框架用 Gradio 搭建了网页界面。它最大的特点是检索式特征替换推理时用 top1 检索把输入音频的音色特征直接替换成训练集里的特征从根上解决原说话人音色泄漏到输出里的问题。适合两类人——想训练 AI 歌手、做语音克隆的创作者以及想实时变声、分离人声伴奏的普通用户。底模用约 50 小时的 VCTK 开源语料训练无版权问题。️ RVC 安装与环境准备在克隆仓库之前先把环境凑齐。三项依赖缺一不可依赖要求说明Python3.8建议 3.8~3.10过高版本装依赖容易冲突PyTorch与显卡匹配N 卡装 CUDA 版A 卡/I 卡走 DirectMLFFmpeg任意较新版本音频读写全靠它Windows 需放到项目根目录sudo apt install ffmpeg # Ubuntu/Debian brew install ffmpeg # macOS预置模型文件RVC 自身代码不包含预训练权重需要额外下载四类资源放到对应目录资源放置位置作用hubert_base.ptassets/hubert/语音内容特征提取模型预训练底模G/D 系列 .pthassets/pretrained/训练的起点v1 版本v2 底模assets/pretrained_v2/效果更好选 v2 训练时需要人声分离模型assets/uvr5_weights/UVR5 伴奏/人声分离用仓库自带下载脚本 tools/download_models.py会一次性把上述文件拉到正确位置比手动下载省事python tools/download_models.py RVC 首次运行从克隆到打开网页最短路径四步git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt python infer-web.py装依赖时按显卡选文件N 卡用requirements.txtA 卡/I 卡用requirements-dml.txtLinux 下的 A 卡 ROCM 用requirements-amd.txt。这一步你应该看到终端滚过一段初始化日志后打印出本地访问地址形如http://127.0.0.1:7860浏览器会自动弹出网页。网页打开后你会看到一排标签页模型推理、伴奏人声分离去混响去回声、训练、ckpt处理、Onnx导出。Windows 用户也可以直接双击go-web.bat启动效果相同。第一次打开时推理音色下拉框是空的这很正常——没有模型训练出第一个才能选。️ 用它做什么训练一个自己的 AI 声线目的用一段目标人物的语音数据产出一个可复用的音色模型。操作切到训练标签页填实验名和训练文件夹路径文件夹里放干净的人声音频设置目标采样率勾选模型是否带音高指导唱歌场景一定要勾然后点一键训练。它会依次完成数据切割、音高提取与特征处理、模型训练和索引训练全程只需看输出信息区滚动。效果训练结束后logs/实验名/下会出现一个 60MB 以上的.pth模型文件和added_开头的.index索引文件前者是音色后者是特征检索库推理时两者配合使用。把一段音频换成目标音色目的拿到训练好的模型后对任意输入音频做整段音色替换。操作切到模型推理 → 单次推理选推理音色填输入音频路径音高提取算法选rmvpe点转换。输出的.wav可以直接在页面上下载试听。效果输出音频的内容、节奏保留自输入音色替换为目标模型。批量处理时切到批量推理标签页即可。另外仓库根目录的go-realtime-gui.bat可以启动实时变声客户端端到端延迟约 170ms配 ASIO 声卡能压到 90ms适合聊天、直播场景。分离人声和伴奏目的拿到一首歌里干净的干声作为训练集或推理输入。操作切到伴奏人声分离去混响去回声标签页选模型版本上传音频点转换。效果基于 UVR5 的分离模型输出人声和伴奏两轨实现逻辑在 uvr5 相关模块。对含混响、回声的录音还能先做去混响处理出来的干声更接近人嘴训练效果更好。⚙️ RVC 参数怎么调效果最好数据准备训练数据推荐至少 10 分钟、低底噪的清晰人声质量比数量重要。音频路径尽量别带中文和空格出错的 FAQ 里一大半和路径有关。唱歌场景务必勾选带音高指导否则音高跟不住旋律。关键参数音高提取算法首选rmvpe效果最好且比 crepe 更省资源见 音高提取与推理库实现纯语音输入可以用pm提速。检索特征占比控制输出音色贴近训练集的程度调高更像目标音色调低更保留原说话人的口齿一般从默认值附近开始试。变调半音数按男女声差和实际听感微调升八度是 12降八度是 -12。保护清辅音和呼吸声protect出现电音、撕裂声时调大它但开太满会削弱索引效果。常见现象与对策一键训练结束但没看到索引文件多为训练集太大导致加索引那步卡住重新点一次训练索引即可。训练完成但推理列表里没有你的音色先点刷新音色列表和索引路径还没有就检查控制台和logs/实验名下的日志。网页提示 Connection Error多半是黑色控制台窗口被关掉了重跑python infer-web.py。想分享模型分享weights/下的 .pth 加对应 .index不要分享logs/下几百 MB 的训练状态文件那只是复现和续训用的。 遇到问题去哪找常见问题解答报错信息直接对号入座装环境、训练报错时第一站看这里。更新日志升级前看一眼确认你依赖的行为有没有变。小白简易教程连数据集怎么整理都没头绪时跟着它从头走一遍。项目还内置了FAQ标签页网页打开时不想切窗口的话可以直接翻。下一步先跑一次 UVR5 把一首歌的干声分离出来用 10 分钟左右的干声训练一个 v2 模型再把自己的清唱丢进单次推理听效果——一个晚上就能走完分离→训练→转换的完整闭环之后再去抠参数就有参照基准了。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表