ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DDSP-SVC 版本对比:从 1.1 到 6.3 的歌声转换演进与选型完整指南

DDSP-SVC 版本对比:从 1.1 到 6.3 的歌声转换演进与选型完整指南 DDSP-SVC 版本对比从 1.1 到 6.3 的歌声转换演进与选型完整指南【免费下载链接】DDSP-SVCReal-time end-to-end singing voice conversion system based on DDSP (Differentiable Digital Signal Processing)项目地址: https://gitcode.com/gh_mirrors/dd/DDSP-SVCDDSP-SVC 是一个基于可微数字信号处理DDSP可以理解为用数学公式直接画出声波而不是让黑盒网络猜的开源实时歌声转换SVC项目目标是让 AI 变声器在个人电脑上跑得起来。相比 SO-VITS-SVC它训练和合成对硬件的要求低得多训练时长有数量级的缩短接近 RVC 的水平。如果你正在纠结 DDSP-SVC 哪个版本好用这篇对比文章可以给你答案。它的版本时间线只有一条主线1.1 多说话人 → 2.0 优化训练并支持 VST → 3.0 引入浅扩散模型提升音质 → 4.0 换 RMVPE 音高提取器并联合训练 → 5.0 换 FCPE 提取器提速 → 6.3 用整流流Rectified-Flow替换扩散模型旧模型不再兼容。版本时间线DDSP-SVC 各版本到底改了什么把 cn_README.md 里的更新日志串起来看每个大版本都对应一个具体痛点版本关键变化对应痛点1.1支持多说话人和音色混合只能练一个人的音色2.0支持实时 VST 插件combsub 模型训练速度极大提升训练太慢、插件依赖问题3.0作者删库 VST 插件、改用独立实时变声前端支持多种编码器contentvec768l12 成为默认引入浅扩散模型合成质量大幅提升DDSP 原始输出音质差4.0支持 RMVPE 音高提取器联合训练 DDSP 与扩散模型两个模型文件分别训练/加载很繁琐5.0支持 FCPE 音高提取器改进 DDSP 与扩散模型音高提取拖慢实时性能6.3改进 DDSP 模型用整流流Rectified-Flow替换扩散模型进一步提升合成质量旧模型不再兼容扩散采样迭代次数多、路径弯音质不够扩散模型、整流流两代修音器的来历DDSP 本身有个绕不开的短板它的原始合成音质不够理想训练时在 TensorBoard 里能直接听到原始输出的效果。3.0 版本的回应是引入浅扩散模型——扩散模型可以理解为把噪声一步步雕刻回声音的过程——在 DDSP 输出之上再叠一层轻量级扩散模块把音质拉到不亚于 SO-VITS-SVC 和 RVC 的水平。4.0 和 5.0 沿用了这条DDSP 扩散的路线只是持续改进两侧模型。到了 6.3 版本作者判断瓶颈在扩散采样本身扩散需要多步迭代生成路径是弯的步数给少了音质掉给多了又慢。整流流换了一种思路——直接学习一条从噪声到声音的直线推理时解一个 ODE常微分方程就行代码见 reflow/reflow.py支持euler和rk4两种求解器还能用t_start参数控制 ODE 的起点。对应地训练入口也换成了 train_reflow.py推理用 main_reflow.py。注6.3 的更新日志明确写着旧模型不再兼容也就是说 3.0~5.0 练出来的模型文件无法被当前代码加载选版本前先确认自己手上有什么。流程繁琐从两个模型文件到联合训练3.0 时代的玩法是先单独训练 DDSP 模型再单独训练扩散模型推理时要把两个权重文件一起加载。对新手来说这意味着配置两份参数、管两个 checkpoint。4.0 版本把扩散模型内嵌进 DDSP 一起联合训练推理时只需要一份模型文件。这个简化一直保留到 6.3整流流模块和 DDSP 主干在同一个 reflow/vocoder.py 的Unit2Wav里一起训练、一起保存一条train_reflow.py命令跑完中途可以随时中断、重跑同一命令续训。音高提取器实时变声的隐形瓶颈变声前要先从音频里提取音高f0也就是每个时刻音的高低提取器太慢实时变声的延迟就上去了。项目在两个版本里连续换了快枪手4.0 引入 RMVPE神经网络音高提取精度优先配置里写成f0_extractor: rmvpe5.0 再引入 FCPE速度更快适合对延迟敏感的实时场景。另外数据集质量不高时官方建议把f0_extractor设回rmvpe用精度换稳定。提取器实现的代码都在 ddsp/vocoder.py 的F0_Extractor类里。DDSP-SVC 版本怎么选一张表看懂各版本差异维度3.04.05.06.3当前推理需要加载的模型文件2 个DDSP扩散1 个1 个1 个支持的音高提取器基础提取器RMVPEFCPERMVPE/FCPE 均可合成增强方式浅扩散模型浅扩散模型联合训练改进的浅扩散模型整流流Rectified-Flow多说话人 / 音色混合支持支持支持支持-mix按权重捏音色实时前端独立 GUI独立 GUI独立 GUIgui_reflow.py滑动窗口 SOLA 拼接 上下文语义参考旧模型向前兼容—兼容 3.0兼容 4.0不兼容 3.0~5.0选型建议按场景一句话给出新手入门直接用当前 6.3 版本默认配置按 RTX 4060 设计从data/train/audio放数据到gui_reflow.py一条线跑通。⚡实时部署同样推荐 6.3实时前端用滑动窗口、交叉淡化、SOLA 拼接低延迟下音质接近非实时合成若你的旧 4.0/5.0 模型还想继续用只能等兼容或留在旧代码分支。前沿研究6.3 的整流流模块独立在 reflow/ 目录下改采样步数、求解器、t_start都方便适合做实验。DDSP-SVC 快速上手命令最短路径只需四步依赖装好后pip install -r requirements.txt # 先按 README 装好 PyTorch python preprocess.py -c configs/reflow.yaml -j 4 # 多进程预处理 python train_reflow.py -c configs/reflow.yaml # 训练可随时中断续跑 python main_reflow.py -i input.wav -m model.pt -o out.wav -k 0 -id 1 -step 50 -method euler # -k 调音高 -step 采样步数预训练编码器、NSF-HiFiGAN 声码器、RMVPE 权重要按 README.md 放到pretrain/对应目录。默认配置在 configs/reflow.yaml44.1kHz 采样率、infer_step: 50、method: euler、n_spk: 1改这个 yaml 就能控制编码器contentvec768l12tta2x/hubertsoft等、说话人数和混合精度fp16/bf16。从 1.1 到 6.3DDSP-SVC 走过的路其实是把能用打磨成一条直线到位模型文件越来越少训练命令越来越少采样路径越来越直。对普通用户而言记住一件事就够——现在装好依赖、跑通configs/reflow.yaml就是站在它最新也最简单的那条线上。【免费下载链接】DDSP-SVCReal-time end-to-end singing voice conversion system based on DDSP (Differentiable Digital Signal Processing)项目地址: https://gitcode.com/gh_mirrors/dd/DDSP-SVC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表