ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GPT-SoVITS 教程:1 分钟人声克隆专属音色,零样本 5 秒出效果

GPT-SoVITS 教程:1 分钟人声克隆专属音色,零样本 5 秒出效果 GPT-SoVITS 教程1 分钟人声克隆专属音色零样本 5 秒出效果【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS做口播最烦的一环是录音换个音色要重录换种语言要再录一遍。GPT-SoVITS 是开源的少样本 TTS 工具5 秒参考音频即可零样本克隆音色1 分钟训练数据就能微调出专属声音支持中、英、日、韩、粤五种语言。能力速览三个数字定标5 秒零样本给一段 5 秒左右的干声不用训练直接合成适合快速验证音色方向。1 分钟少样本1 分钟干净人声微调后音色相似度明显高于零样本——这是它的核心卖点预训练语料已从 2k 小时扩到 5k 小时小数据也能压住。RTF 0.014v2ProPlus 在 RTX 4090 上的实测值约 1400 词4 分钟语音只需 3.36 秒合成4060Ti 上 0.028M4 纯 CPU 也有 0.526长文本不再是瓶颈。48kHz 原生输出v4 声码器直接产 48k 音频成品无需再升采样就能交付。3 步拿到第一条合成音频Linux/macOS 下先建好 conda 环境python3.10然后git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source HF python webui.py--device按硬件选 CU126/CU128/ROCM/MPS/CPU脚本会装对应 PyTorch 并拉取预训练模型。--source选模型下载源国内网络建议 ModelScopeWindows 用install.ps1替代。装完启动 WebUI浏览器打开 9874 端口上传参考音频即可试听训练、切分、人声分离也都在这个界面里。白话原理48k 干净音质怎么来的把它理解成编剧 录音师的分工GPT 部分负责语义和韵律这句话怎么断句、哪里重读SoVITS 声码器负责声学细节音色、气息。两段式结构让每个模块只做自己擅长的事这也是 1 分钟数据就能收敛的原因。音质上 v4 的关键改动在 GPT_SoVITS/configs/s2v2ProPlus.json 里声码器的上采样链是 10×8×2×2×2全部整数倍。非整数倍上采样会引入频谱伪影听着就是金属音整数倍等于把 32kHz 内部特征一次性干净地展开到 48kHz从根上消除了 v3 时代靠 24k 转 48k 外挂超分模型的补丁方案。容易被忽略的三个取舍v4 还是 v2Prov4 音色保真、高频干净但对训练数据质量挑剔语料有明显底噪时改选 v2Pro 系列官方口径是音质接近 v4硬件占用和速度却等同 v2。半精度开关GPT_SoVITS/configs/tts_infer.yaml 里is_half在新显卡上默认 true速度更快、显存更省显存不足时关掉用 FP32 跑。Mac 用户注意用 MPSGPU 模式训练出的模型质量明显低于其他设备官方建议 Mac 训练走 CPU 模式推理则不受影响。另有一个不直观的点训练集和推理文本可以不同语言中文数据训出的模型能直接说日语、韩语跨语言配音不用为每种语言单独攒素材。自检清单出了问题先问这四个问音色下拉框是空的答预训练权重没落位。检查 GPT_SoVITS/pretrained_models/ 下是否有对应版本的.pth/.ckptv4 需要gsv-v4-pretrained/s2Gv4.pth缺了就重跑安装脚本的下载步骤。问合成音频有金属音答多半还在用 v3 声码器或旧版vocoder.pth。换 v4 权重并重新下载声码器文件整数倍上采样配置下金属音是 v3 的遗留问题。问训练效果反而不如 v2答v3/v4 对数据质量敏感先经 tools/uvr5/ 做人声分离、tools/cmd-denoise.py 降噪把训练集洗一遍再训洗不动就直接退回 v2Pro 系列。问长文本合成显存溢出答把文本分段合成参考音频保持在 5 秒左右仍不够就关半精度或改用 GPT_SoVITS/export_torch_script.py 导出优化模型走 CPU 推理。版本升级前建议扫一眼 docs/en/Changelog_EN.md各版本预训练权重不互通混着用会直接报错。先用 5 秒参考音频跑通零样本链路再录 1 分钟干净人声做微调对比两者的相似度差异——这一步走完你就知道这个模型适不适合你的工作流了。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表