
1 分钟录音克隆音色、原生 48k 输出GPT-SoVITS 少样本 TTS 入门实操【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个少样本 TTS文本转语音项目5 秒参考音频即可零样本克隆音色1 分钟训练数据足以微调出高相似度的专属声音。v4 版本原生输出 48kHz 音频v2ProPlus 版本在 RTX 4090 上 RTF 低至 0.014——1400 词文本 3.36 秒合成完毕覆盖中、英、日、韩、粤五种语言。动手前先核对的门槛语言环境conda Python 3.10这是整套安装脚本的前提。显卡NVIDIA 卡需支持 CUDA 12.6 或 12.8AMD 走 ROCmMac 走 MPS也支持纯 CPU。性能参考官方实测v2ProPlus 推理 RTFRTX 4090 为 0.0144060Ti 为 0.028M4 CPU 为 0.526——有独显接近实时无独显也能跑。显存官方未给最低显存档位显存紧张时关闭半精度即可明显降低占用。磁盘预训练模型 日语/英语发音词典等数据体积不小预留充足空间。3 条命令跑起 WebUIgit clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS bash install.sh --device CU128 --source ModelScope关键参数逐条说明--device按硬件五选一CU126/CU128NVIDIA、ROCMAMD、MPSApple 芯片、CPU。--source是模型下载源国内网络建议ModelScope海外可选HF或HF-Mirror。追加--download-uvr5可顺带拉取人声分离模型为后续处理带背景音乐的素材做准备。脚本会把各版本权重解压进 GPT_SoVITS/pretrained_models/装完执行python webui.py浏览器打开 9874 端口即进入 WebUI试听、切分、标注、训练都在网页里完成。v4 权重需确认该目录内含gsv-v4-pretrained/s2Gv4.pth与vocoder.pth缺一都会导致对应版本不可用。v4 的干净 48k 音质从何而来 整数倍上采样声码器的上采样链在 GPT_SoVITS/configs/s2v2ProPlus.json 中为 10×8×2×2×2全部整数倍。对使用者意味着 BigVGAN 直接产出 48k 音频v3 因非整数倍上采样引入的金属音从源头消失。两段式分工GPT 模型管说什么、怎么起伏语义与韵律SoVITS 管听起来像谁声学细节。预训练语料从 2k 小时扩到 5k 小时所以 1 分钟数据微调后的相似度明显优于零样本直出。半精度默认开启GPT_SoVITS/configs/tts_infer.yaml 里较新显卡默认is_half: true。意味着不用任何设置就能获得更快的推理速度和更低的显存占用。版本与精度怎么选按数据质量选版本WebUI 模型下拉框里v4 音色保真、高频最干净训练集本身音质一般时改选 v2Pro 系列——官方口径是音质接近 v4而硬件占用与速度等同 v2更稳。半精度开关显存不足就关半精度、以 FP32 跑SM 6.1 以上的新卡保持 FP16推理更快。CPU 场景用 GPT_SoVITS/export_torch_script.py 导出优化后的模型再推理速度明显好于直接跑长文本分段合成参考音频控制在 5 秒左右效果最稳。它适合谁短视频 / 播客创作者录 1 分钟自己的声音做微调后续口播全部由模型生成48k 成品无需再升采样直接进剪辑软件交付。跨语言配音用中文素材训练一次推理时切换日语、韩语、英语文本WebUI 自带 UVR5 人声分离、自动切分和 ASR 标注一套页面就能攒出可用训练集。影视二创与配音修复带 BGM 或噪声的旧素材先分离人声、再降噪然后合成干净的替代配音原声不必再录。五个高频问题速查 音色下拉框为空→ 预训练权重缺失或放错目录 → 核对 GPT_SoVITS/pretrained_models/ 下是否含对应版本的.pth/.ckpt文件。提示未找到显卡、自动退回 CPU→ 显卡驱动或 CUDA 运行时缺失 → 先装好驱动重装或显式指定--device CPU。合成出现金属音→ 仍在用 v3 权重或非整数倍上采样配置 → 换 v4 版本并重新下载最新的vocoder.pth。v3/v4 训练效果差、反不如 v2→ v3/v4 对训练数据质量挑剔 → 先做人声分离与降噪或改选 v2Pro 系列。显存溢出 / Mac 上训出的模型质量偏低→ 前者关半精度或换大显存卡CPU 训练只适合少量数据试跑后者属已知现象官方建议 Mac 用户改用 CPU 模式训练。最小上手路径第一步挑一段 5 秒清晰人声做零样本合成确认装环境 → 起 WebUI → 出音频整条链路通了。第二步再准备 1 分钟干净人声做微调对比两次结果的相似度差异——这个对比值决定你要不要投入更多数据。升级版本前先扫一眼 docs/en/Changelog_EN.md 的更新记录确认改动点再迁移。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考