ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

5分钟跑通 VoxCPM:文本转语音与声音克隆完整上手指南

5分钟跑通 VoxCPM:文本转语音与声音克隆完整上手指南 5分钟跑通 VoxCPM文本转语音与声音克隆完整上手指南【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM给一段文字、再喂 10 秒参考录音一分钟就能拿到一个音色几乎一模一样的声音。VoxCPM 是一套文本转语音与声音克隆系统没有离散音频分词器就是把声音切碎编码成一个个 token 的做法直接从文本生成连续语音原生输出 48kHz 高质量音频支持 30 种语言和 9 种中文方言。读完这篇文章你会完成三件事用一行命令装好最新的 VoxCPM2 并合成第一条 48kHz 语音用一段参考音频克隆目标音色再用自然语言调它的说话风格看懂最常用的三个参数在什么现象下该怎么动。全程不需要你手动准备模型权重首次运行会自动下载。 30 秒环境检查确认机器能跑起来开跑前对照这一张清单缺哪项补哪项Python 版本 3.10 及以上、低于 3.13PyTorch 2.5.0 及以上有 NVIDIA GPU 最好显存 8GB 以上VoxCPM2 约吃 8GB没有也能跑用 CPU 或 Apple Silicon 只是更慢用 NVIDIA 卡的话 CUDA 12.0 及以上联网首次运行要自动下载模型权重安装本身就一行pip install voxcpm️ 第一条语音从安装到 .wav 只要三步先装包一行搞定pip install voxcpm然后建一个脚本下面这段代码加载模型、合成一句话、存成 wavfrom voxcpm import VoxCPM import soundfile as sf # 这一步把模型拉下来首次会比较慢耐心等等 model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate(text你好这是由VoxCPM合成的第一条语音。, seed42) sf.write(demo.wav, wav, model.tts_model.sample_rate)python your_script.py能正常播放 demo.wav 的话模型已经在跑了。到这里核心路径走完剩下的是换个姿势和调效果。 换个姿势用命令行一行出语音Web 界面点点点不想写脚本的话装包时已经带好了voxcpm命令实现就在 src/voxcpm/cli.pydesign、clone、batch三个子命令覆盖日常场景。用文字描述凭空造一个音色不需要任何参考音频# 音色设计括号里的描述决定说话人是什么样 voxcpm design --text VoxCPM2带来全新语音合成体验。 \ --control 年轻女声温暖温柔略带微笑 \ --output out.wav或者拿一段录音克隆音色仓库里正好有个现成的参考音频可以试# 声音克隆只给参考音频不用写转录文本 voxcpm clone --text 这是一个声音克隆的演示。 \ --reference-audio examples/reference_speaker.wav \ --output clone.wav更喜欢图形界面就起 Web Demo启动后浏览器打开 8808 端口操作即可python app.py --port 8808命令行版和图形版都备好了日常用哪个都行。⚙️ 调参手册声音发紧、发闷、不稳时改哪里三个参数最影响听感每个都按现象 → 调整 → 预期来记cfg_value引导强度推荐 1.0–3.0默认 2.0现象声音发紧、发僵或者没按你描述的音色来调整发紧就往低调比如 1.5要求严格贴文本、贴提示就往高调预期调低后语气更松弛自然调高后文本遵循度更高inference_timesteps扩散步数推荐 4–30默认 10现象出音频太慢或者细听音质差点意思调整赶时间用 4–6追求音质用 15–20预期步数越高音频细节打磨越充分代价是生成时间变长seed随机种子默认不固定现象同一句话生成两次风格一次像一次不像调整固定 seed 可复现结果不满意就换几个 seed 各出一版再挑预期固定后结果可重复多 roll 几次能稳定挑到满意的那版️ 踩坑与技巧4 个高频问题首次下载慢或失败怎么办模型默认从 Hugging Face 拉取。国内网络可以先pip install modelscope用snapshot_download(OpenBMB/VoxCPM2)先下到本地再把本地路径传给from_pretrained详见 README_zh.md 的快速开始部分。参考录音有底噪克隆出来发闷生成时加--denoise会先对参考音频做增强再克隆。音色设计结果每次都不一样正常吗正常。官方说明可控生成的结果会随生成次数波动建议每次连生成 1–3 版再挑选这是目前的设计特性。显存不够 8GB 跑不动VoxCPM2 约 8GB 显存。可以加--device cpu或mps降级运行速度会明显变慢也可以改用更小的 VoxCPM1.5显存约 6GB版本差异对比见 README_zh.md 的模型表格。 继续深挖源码和材料都在这一句话收尾VoxCPM 把文本变语音、语音变任意人声压缩到了几行代码的距离。想往下走的话CLI 的完整参数在 src/voxcpm/cli.py想给模型微调自己的声音训练脚本是 scripts/train_voxcpm_finetune.pyLoRA 配置在 conf/voxcpm_v2/数据格式参考 examples/train_data_example.jsonl也可以直接跑 lora_ft_webui.py 用网页做训练。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表