ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

开源对决闭源:Raon-OpenTTS-1B与Qwen3-TTS、CosyVoice 3、F5-TTS正面硬刚

开源对决闭源:Raon-OpenTTS-1B与Qwen3-TTS、CosyVoice 3、F5-TTS正面硬刚 开源对决闭源Raon-OpenTTS-1B与Qwen3-TTS、CosyVoice 3、F5-TTS正面硬刚【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1BRaon-OpenTTS-1B 是 KRAFTON 推出的开源 TTS文本转语音模型权重与训练数据全量开放主打零样本文本转语音与声音克隆。本文用 Seed-TTS-Eval、CV3-Eval、Raon-OpenTTS-Eval 三套官方基准把它和 Qwen3-TTS、CosyVoice 3、F5-TTS 三个强敌逐项对比看开源到底追平了多少。Raon-OpenTTS-1B 是什么全开放的零样本 TTS 模型先说清楚几个关键词方便新手理解零样本Zero-shotTTS只需提供几秒钟参考音频就能克隆出说话人的音色无需针对目标声音训练。开放数据 开放权重不仅模型文件公开61.5 万小时的英语训练语料池Raon-OpenTTS-Pool也同步开源任何团队都能复现研究。架构基于 F5-TTS 的 DiTDiffusion Transformer Flow Matching1.0B 参数16kHz 输出搭配 HiFi-GAN 声码器。它用 51 万小时精筛数据、48 张 B200 GPU 训练 52 万步而成。仓库内核心文件一目了然文件作用model_520000.pt模型权重520K 步训练产物config.yaml架构配置dim1408、depth28、heads24 等vocab.txt文本分词词表README.md模型说明与完整基准数据⚖️ 需要注意许可证为CC BY-NC 4.0仅限非商业使用商用前请自行评估。对决一Seed-TTS-Eval 声音克隆相似度排名这是业界最常用的零样本 TTS 评测WER 衡量发音准确度越低越好SIM 衡量音色还原度越高越好模型参数量WER(%) ↓SIM ↑人类基准-2.140.734Qwen3-TTS1.7B1.460.715CosyVoice 31.5B2.210.720F5-TTS0.3B2.040.671Raon-OpenTTS-1B1.0B1.780.749 结论Qwen3-TTS 的发音准确率WER略胜但Raon-OpenTTS-1B 的音色相似度 0.749 位列全场第二——仅次于用闭源私有数据训练的 Seed-TTS0.762并跑赢人类基准0.734。用克隆得像不像这把尺子量开源模型已经摸到闭源天花板。对决二CV3-Eval 困难音频挑战CV3-Eval 难度更高CV3-Hard-EN 专门考验复杂文本与发音场景模型CV3-EN WER(%) ↓困难集 WER(%) ↓困难集 SIM ↑困难集 MOS ↑F5-TTS8.54---CosyVoice 34.9610.770.7403.98Qwen3-TTS4.527.890.6663.87Raon-OpenTTS-1B3.926.150.7753.85 这一局 Raon-OpenTTS-1B通吃 WER 与 SIM 两项第一且参数量只有对手的六成左右。唯一小遗憾是感知音质MOS3.85 略低于 CosyVoice 3 的 3.98但差距在可听感阈值边缘。对决三真实环境噪声与情感压力测试Raon-OpenTTS-Eval 覆盖 Clean / Noisy / Wild / Expressive 四类声学环境共 6 千条样本是最贴近真实场景的压力测试模型综合 WER(%) ↓综合 SIM ↑野外(Wild) WER(%) ↓F5-TTS25.080.542136.03CosyVoice 34.430.6478.31Qwen3-TTS17.590.62679.14Raon-OpenTTS-1B2.810.6955.61⚡ 这一局是碾压级差距Qwen3-TTS 和 F5-TTS 在野外噪声环境下 WER 直接爆表79%、136%而 Raon-OpenTTS-1B 全程稳定在 1.44 ~ 5.61 区间四种环境 WER 与 SIM 均值均为全场最佳。背景噪声、情绪化表达、口音等脏场景下它对闭源对手的领先是断层的。为什么开源能硬刚闭源3 个核心原因数据质量 数据堆量。Raon-OpenTTS-Core 的 51 万小时并非原始堆料而是用 DNSMOS WER VAD 三重排序过滤精筛而来——高质量数据打穿了对手百万小时私有语料的数量壁垒。架构选得对。DiT Flow Matching 的扩散式架构天然适合非自回归语音生成配合 RMSNorm 与卷积层见config.yaml在相似度与速度之间取得平衡。全开放本身就是壁垒。权重、数据、训练细节AdamW、峰值学习率 1e-4、50K warmup 等全部透明科研社区可以真正复现与改进这是闭源模型做不到的。如何获取 Raon-OpenTTS-1B完整步骤仓库为模型镜像仓库包含权重、配置与词表git clone https://gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B克隆后你会得到model_520000.pt权重、config.yaml架构配置、vocab.txt词表三个运行核心文件。推理脚本与使用教程请查阅官方代码仓库KRAFTON 开源的 Raon-OpenTTS 项目配合 Hugging Face 上的配套数据集 Raon-OpenTTS-Pool 即可体验零样本声音克隆。一分钟速览这场对决谁赢了比拼维度胜者音色克隆相似度SIM Raon-OpenTTS-1B困难文本准确率WER Raon-OpenTTS-1B真实环境鲁棒性 Raon-OpenTTS-1B标准集发音准确率 Qwen3-TTS感知音质DNSMOS CosyVoice 3总结在 3 套基准的 8 个关键指标中Raon-OpenTTS-1B 拿下 5 项第一包括决定克隆像不像的音色相似度和最难啃的真实环境鲁棒性。它证明了一件事——开放数据 开放权重的零样本 TTS已经能正面硬刚百万小时闭源语料训练的旗舰模型。若你做的是英文声音克隆、有声内容或语音助手原型非商业这个 1B 开源模型值得第一时间加入你的候选清单。️【免费下载链接】Raon-OpenTTS-1B项目地址: https://ai.gitcode.com/hf_mirrors/KRAFTON/Raon-OpenTTS-1B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表