ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GPT-SoVITS 完整指南:如何用 5 秒音频克隆出可用的音色

GPT-SoVITS 完整指南:如何用 5 秒音频克隆出可用的音色 GPT-SoVITS 完整指南如何用 5 秒音频克隆出可用的音色【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS手里只有一段 5 秒的人声录音能不能做出一个能读长文的声音GPT-SoVITS 给出的答案是能把这段录音作为参考音频它就能直接零样本语音合成——用这个人的音色朗读任意新文本一行代码都不用改再拿大约 1 分钟的干净语音做少样本语音训练音色相似度还能再上一个台阶。配合内置的 Web 界面整个流程不需要手写训练脚本。对内容创作者、配音从业者、想做个性化语音助手的开发者来说这是一台门槛很低的克隆音色生产线。三步完成 GPT-SoVITS 安装环境方面官方验证过的组合是 Python 3.10 PyTorch 2.5.1 CUDA 12.4也支持 CPU 和 Apple 芯片。每个平台选一条路径即可Windows下载官方整合包7z 压缩包解压后双击go-webui.bat直接进入 WebUI。Linux / macOS用 conda 建环境后跑安装脚本脚本会按设备类型拉取依赖和预训练模型conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128|CPU|MPS --source HF|HF-Mirror|ModelScopeDockerdocker compose run --service-ports GPT-SoVITS-CU128一条命令起容器界面默认开在 9874 端口。装完打开浏览器看到标注、切片、ASR、训练、推理几个标签页说明部署成功。从一段原声到一条克隆语音整个上手过程可以按输入 → 加工 → 输出一条线走下来。输入把目标说话人的原始音频丢进项目根目录的logs文件夹。加工WebUI 内置了一条完整的工具链不需要第三方软件——先用 UVR5 把伴奏和人声分离、只留人声再用自动切片slicer2.py把长音频按音量切成适合训练的短句接着跑多语言 ASR 把每句的文本转写出来中文/英/日/韩默认走 Fun-ASR-Nano 系模型粤语保留经典 FunASR 后端见 tools/asr/最后在标注页人工校对文本。训练清单每行是一个片段格式为音频路径|说话人|语言代码|文本内容用竖线分隔。输出校对完成后在 WebUI 启动微调训练几分钟到几十分钟得到一个专属模型推理页输入文本、选参考音频和参考文本调语速音高后就能导出合成语音。不训练也能先用零样本模式出第一条克隆语音——参考音频放 5 秒就够。五语支持一览zh/en/ja/ko/yue代码语言说明zh中文默认语种文本前端最全en英语用内置 CMU 发音词典ja日语依赖 g2p 转换ko韩语V2 版本加入yue粤语用经典 FunASR 后端转写它为什么能做到GPT 模块、SoVITS 模块与 BigVGAN系统由三段接力完成。第一棒是 GPT 模块GPT_SoVITS/AR/自回归地预测语音的离散 token 序列负责说什么、什么节奏5 秒零样本克隆就靠它在一次推理里记住参考音色。第二棒是 SoVITS 模块GPT_SoVITS/module/把 token 序列还原成声学特征决定音质和音色细节。第三棒是 BigVGAN 声码器GPT_SoVITS/BigVGAN/——把声学特征变成最终波形的部件直接影响听感。三个关键设计少样本适应对比学习让 1 分钟数据就能把音色拽向目标说话人而不需要几百小时语料。跨语言统一表示所有语种映射进同一套 token 空间所以用中文语料训完可以直接合成日语、英语。fp16 实时推理半精度加速下v2 ProPlus 在 4090 上 RTF 约 0.0141400 词、约 4 分钟的语音只需 3.36 秒4060Ti 约 0.028M4 芯片纯 CPU 约 0.526基本可实时。版本演进一句话带过V2 补上韩语与粤语并优化文本前端V3 显著改善音色相似度与情感表现官方预训练数据也从 2k 小时一路扩到 10k 小时。排坑常见四类问题的原因与解法合成有底噪、发闷多半是输入音频不干净。先用 UVR5 分离 降噪切片时适当调高音量阈值。5 秒零样本相似度不够零样本本来就是近似把 1 分钟左右的干净人声拿去做微调相似度会有肉眼可见的提升。跨语言念起来外语腔明显参考音频和目标语言风格差太远会拖后腿换一段更接近目标语种的参考音频再试。显存吃紧推理开 fp16is_half训练减小 batch size 或改用梯度累积长文本分段合成比一次整段更稳。适用场景与后续走向影视配音、有声书量产、语音助手定制音色、多语言教学素材、游戏角色语音这些场景基本都能落在5 秒试听 1 分钟微调的工作流里。项目路线图指向更细的情感控制、混合模型实验、更大规模预训练和更小体积的模型。对刚进入 AI 语音方向的人来说GPT-SoVITS 是一个能立刻跑通全链路、又值得逐层读源码的项目。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表