ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

1 分钟声音克隆:少样本语音合成快速上手完整指南

1 分钟声音克隆:少样本语音合成快速上手完整指南 1 分钟声音克隆少样本语音合成快速上手完整指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS录 1 分钟自己的声音AI 就能用你的音色朗读任意文字——这是 GPT-SoVITS 开源声音克隆系统做的事5 秒参考音频即可零样本合成1 分钟数据微调后相似度更高还覆盖中、英、日、韩、粤五种语言互推。下面不按功能清单罗列而是按你的目标推进先把环境跑起来再克隆出一个能用的声音最后绕开最常见的坑。能力速览适合谁、能做什么、门槛多高 适合谁能做什么硬件门槛想克隆自己或他人声音的开发者1 分钟音频微调出专属音色WebUI 内置切分、降噪、ASR 标注全套工具建议 N 卡CUDA 12.4 / 12.8Python 3.10 起步没有独显、只想体验的人5 秒参考音频零样本合成完全不用训练CPU 也能推理M4 实测 RTF 0.526macOS 可走 MPS想接入自己项目的用户提供 api.py / api_v2.py 接口Docker 镜像支持 amd64 / arm64容器内跑GPU 可选官方验证过的环境组合是 Python 3.9~3.12 搭配 PyTorch 2.2~2.8按自己的显卡选 CUDA 12.4 或 12.8 就行不用纠结。5 分钟跑起来声音克隆环境最快搭建 Windows 上最快的路径是官方集成包下载解压后双击go-webui.bat浏览器自动打开 WebUI全程不碰命令行。Linux / macOS 用户用 Docker 最省事git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS.git cd GPT-SoVITS docker compose run --service-ports GPT-SoVITS-CU126服务名按 CUDA 版本选 CU126 或 CU128。完整版镜像自带多语言 ASR 和 UVR5 人声分离模型开箱即用Lite 轻量版不含这两类模型——UVR5 权重需手动下载ASR 首次使用时自动拉取只推理不训练选 Lite 完全够用。想手动装环境的话conda 里一条bash install.sh --device CU126 --source HF就能拉齐依赖--device支持 CU128 / ROCM / CPU / MPS--source可换成 HF-Mirror 或 ModelScope。从一段声音到 AI 声音1 分钟克隆声音的最快流程 ️目标拿 1 分钟人声得到一个能合成新文本的模型。全程在 WebUI 里点按钮完成启动总控界面只需python webui.py第一步录素材。要干声无 BGM、无混响、没有旁人插话每段 1~10 秒。素材干净程度直接决定克隆上限。第二步切分与降噪。内置 slicer 按响度自动切段默认响度阈值 -40、最短片段 2000ms、片段间隔 300ms、步进 10一般不用动如果伴奏明显先过一遍 UVR5 分离出人声。第三步标注文本。ASR 自动转写后逐条人工校对。标注文件是 .list每行四段vocal_path|speaker_name|language|text语言代码用 zh / ja / en / ko / yue。第四步微调。训练分两步走可以类比先听写笔记再照着笔记复述先从语音里提取语义编码再拿编码去训练语音合成器。WebUI 里一次点击两步会自动跑完超参数都在 GPT_SoVITS/configs/ 的 yaml / json 里新手不用改。第五步生成。打开推理界面选微调后的模型贴一段 3~10 秒参考音频输入文本即可。不想训练的话直接用预训练模型 5 秒参考音频做零样本合成也能出效果。关键参数汇总环节参数建议值切分响度阈值 threshold-40切分最短片段 / 最小间隔2000ms / 300ms标注语言代码zh、ja、en、ko、yue微调batch_size显存吃紧就减半推理is_half 半精度GPU 支持就打开生成速度参考v2 ProPlus 实测 RTF硬件RTF体感RTX 40900.014约 4 分钟文本 3.4 秒出音频RTX 4060 Ti0.028日常使用足够M4 CPU0.526慢但能跑版本选择速查表V2、V3、V4、V2Pro 怎么选版本核心变化什么时候选它V2新增韩语、粤语预训练语料从 2k 扩到 5k 小时低质量参考音频更稳训练集音质一般、想要结果稳定V3相似度上限更高GPT 更少重复漏字情感表达更丰富原生 24k 输出追求相似度、能接受 24kV4修复 V3 的金属音原生 48k 输出不发闷默认选择作者视为 V3 的直接替代V2Pro显存比 V2 略高效果超过 V4速度和硬件成本与 V2 持平显存紧张但想要更好的效果如果是我我会选 V4音质上限最高金属音也修掉了如果训练集是带底噪的普通录音就退 V2Pro它对低质量素材更宽容。另外 V3/V4 的音色更贴参考音频V2 系更贴训练集整体所以参考音频一定要选干净的。踩坑实录数据、显存、音质三类高频问题 ️数据类Q训练不收敛、克隆不像九成是素材问题带 BGM、混响、旁人插话的片段都会拉低上限。ASR 转写后逐条校对、删掉脏数据1 分钟干净人声比 10 分钟嘈杂录音有用得多。Q标注写错格式或语言.list 每行用竖线分隔四段语言代码写错比如粤语写成 zh会直接带偏发音日文训练时根目录里别放特殊字符。显存类Q显存不够怎么办三个方向batch_size 减半训练和推理都打开 is_half 半精度省显存还提速16 系等不支持半精度的卡会被自动强制单精度训练属正常现象不用慌。音质类Q合成有金属音或声音发闷多半在用 V324k 非整数倍上采样会引入金属音V4 已修复并原生输出 48k升级即可。Q声音像参考音频而不是训练集这是 V3/V4 的固有倾向把参考音频换成更干净、无杂音的 3~10 秒片段能明显改善。下一步可以直接动手先用 5 秒零样本确认环境正常再录 1 分钟干净人声走一遍完整微调效果满意后把模型通过api_v2.py接入你自己的应用。想看各版本的具体改动docs/cn/Changelog_CN.md 里都有记录。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表