DIAMOND技术报告解读:深入理解语音修复模型的创新与突破 DIAMOND技术报告解读深入理解语音修复模型的创新与突破【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0DIAMOND是一款革命性的语音修复模型它通过自回归RQ-Transformer处理神经音频编解码器令牌将受损音频转化为接近录音室质量的44.1 kHz语音。作为一款生成式序列到序列模型DIAMOND不仅能够去除噪音更能生成缺失的音频内容为语音修复领域带来了突破性进展。核心技术解析双Transformer架构的创新设计DIAMOND采用了独特的双Transformer架构这一设计是其实现高质量语音修复的关键。模型包含两个主要部分时间Transformertime-transformer和深度Transformerdepth-transformer。时间Transformer负责对帧序列进行建模而深度Transformer则处理每个帧内的9个RVQ码本。这种结构恢复了RVQ的因果链并分布了输出投影与早期模型通过并行头从单个帧向量中读取所有九个码本的方式形成鲜明对比。模型的整体参数约为166.6M可训练参数其中编码器为双向Transformer包含20层、512维、8个注意力头63.9M参数解码器/时间Transformer采用因果自注意力和交叉注意力机制同样包含20层、512维、8个注意力头88.7M参数码本读取/深度Transformer则在帧的9个RVQ码上进行局部自回归包含4层、384维、6个注意力头14.0M参数。值得注意的是DIAMOND是完全从零开始训练的没有使用任何预训练的语音骨干网络这使得它在同类模型中脱颖而出成为最强的从零开始训练的语音修复器。性能表现质量与内容的平衡DIAMOND在750个真实受损录音上进行了测试使用DNSMOS-P.835原始sig_bak_ovr.onnx评估感知质量使用CER字符错误率评估内容保留度。测试结果显示DIAMOND在感知质量上排名第二仅次于Sidon模型DNSMOS OVRL得分为3.829超过了RE-USE、Resemble Enhance、UniSE和VoiceFixer等模型。在内容保留方面DIAMOND的CER中位数为0.028虽然略高于RE-USE和输入受损音频但考虑到其作为自回归模型的特性这一表现已经相当出色。研究表明自回归解码固有的暴露偏差是导致CER差距的主要原因而非模型容量限制。DIAMOND能够改善约88%的音频片段平均ΔOVRL整体质量提升为0.255这一提升在听觉上是显著的即使不使用耳机也能明显感受到。实际应用从离线修复到数据集净化DIAMOND最适合用于离线修复和数据集净化任务。它能够将大量受损录音如播客、采访、档案和经过有损编解码器处理的用户生成音频转化为足够干净的素材用于训练其他语音模型。在项目的samples目录下提供了多个修复前后的音频示例展示了DIAMOND的实际效果example1_degraded.wav → example1_restored.wavDNSMOS OVRL从2.16提升到3.501.34example2_degraded.wav → example2_restored.wavDNSMOS OVRL从2.83提升到3.590.76example3_degraded.wav → example3_restored.wavDNSMOS OVRL从2.56提升到3.651.10example4_degraded.wav → example4_restored.wavDNSMOS OVRL从3.32提升到3.890.57这些示例充分展示了DIAMOND在处理不同程度受损音频时的能力。使用注意事项了解模型的局限性虽然DIAMOND在语音修复方面表现出色但在使用时仍需注意以下几点CER尾部较薄作为自回归解码器DIAMOND在处理困难片段时偶尔会出现单词模糊的情况。尽管推理保护措施如分块解码、重复惩罚可以降低这种风险但在内容保真度至关重要的场景下仍需检查转录文本。解码是串行的非实时DIAMOND需要逐帧处理每秒音频需要处理86帧加上深度处理因此它适用于离线修复而非实时过滤。以英语为中心训练数据主要是英语其他语言的效果未经测试。生成而非过滤编解码器截止频率以上的内容是根据上下文生成的是合理的推测而非真实恢复。因此不要将输出视为所说内容的法医证据。负责任地使用修复后的语音是合成语音不要将其呈现为未修改的录音也不要用它来伪造或错误归因某人的言论。技术细节模型训练与实现DIAMOND的训练数据包含681.5小时的录音室语音约2.5k名说话者其中28%为原生宽带音频。模型使用了多种先进技术包括RMSNorm、可学习的每层RoPE、QK-Norm、LayerScale和GELU FFN等。音频编解码器采用Descript Audio Codec支持44.1 kHz采样率、9码本RVQ86帧/秒。该编解码器约74M参数在运行时下载并冻结不参与训练。模型的输入可以是任何采样率的音频内部会重采样到24 kHz输出为44,100 Hz。整个训练过程耗时约63 GPU小时最终得到发布的检查点。总结语音修复的新里程碑DIAMOND通过创新的双Transformer架构和自回归RQ-Transformer设计为语音修复领域树立了新的标准。它从零开始训练却达到了与使用预训练骨干网络的模型相当的性能证明了其架构设计的优越性。无论是用于离线语音修复还是大规模数据集净化DIAMOND都展现出了强大的能力。虽然作为自回归模型存在一些固有的局限性但其在感知质量和内容保留方面的平衡表现使其成为语音修复任务的理想选择。随着技术的不断发展我们有理由相信DIAMOND及其后续改进版本将在语音处理领域发挥越来越重要的作用为用户带来更高质量的语音修复体验。引用与致谢如果您在研究中使用了这项工作请引用software{diamond_2026, author {Almaz Zholdoshbek uulu, Ulanbek Abdurazakov, Denis Pavlov and Nursultan Bakashov}, title {Diamond: A Sequence-to-Sequence Model for Speech Restoration via an Autoregressive RQ-Transformer over Neural Audio Codec Tokens}, year {2026}, publisher {Hugging Face}, howpublished {\url{https://huggingface.co/nineninesix/diamond-1.0}}, note {Trained from scratch; no pretrained backbone} }DIAMOND的开发基于Descript Audio Codec的冻结令牌空间训练数据来自LibriTTS-R、Hi-Fi TTS和VCTK等语料库。评估使用了DNSMOS P.835和faster-whisper等工具。许可证信息DIAMOND模型及其权重以Apache License 2.0发布。运行时下载的冻结Descript Audio Codec带有其自己的许可证MIT。要开始使用DIAMOND您可以克隆仓库https://gitcode.com/hf_mirrors/nineninesix/diamond-1.0获取完整的模型和示例文件。【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

本月热点