DIAMOND语音修复核心技术解析:双Transformer架构如何实现44.1kHz高质量音频恢复

发布时间:2026/7/20 18:56:39
DIAMOND语音修复核心技术解析:双Transformer架构如何实现44.1kHz高质量音频恢复 DIAMOND语音修复核心技术解析双Transformer架构如何实现44.1kHz高质量音频恢复【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0DIAMOND是一款基于双Transformer架构的语音修复模型能够将受损音频转化为接近 studio 级别的44.1 kHz语音。它通过双向Transformer对受损的梅尔频谱进行编码利用带有交叉注意力的自回归解码器预测冻结神经音频编解码器的令牌进而合成修复后的波形。双Transformer架构时间与深度维度的创新设计DIAMOND的核心亮点在于其Two-transformer read-out设计通过时间Transformertime-transformer和深度Transformerdepth-transformer的协同工作实现了对音频序列的精准建模与修复。时间Transformertime-transformer捕捉序列动态作为解码器的重要组成部分时间Transformer采用因果自注意力与交叉注意力机制共包含20层512维模型维度和8个注意力头拥有88.7M的参数规模。它主要负责对音频帧序列进行建模捕捉时间维度上的语音动态变化为后续的深度处理奠定基础。深度Transformerdepth-transformer精细处理RVQ码本深度Transformer则专注于对每个帧内的9个RVQ码本进行局部自回归处理。它包含4层384维模型维度和6个注意力头参数规模为14.0M。这一设计恢复了RVQ的因果链并实现了输出投影的分布式处理区别于早期模型通过并行头从单个帧向量中读取所有九个码本的方式提升了修复的精度和效率。核心技术参数与优势模型基本信息模型类型自回归序列到序列语音修复模型编码器 基于编解码器令牌的RQ-Transformer解码器编码器双向Transformer无下采样 - 20层512d8头63.9M参数总可训练参数约166.6MDAC编解码器约74M在运行时下载且冻结音频编解码器Descript Audio Codec - 44.1 kHz9码本RVQ86帧/秒输入/输出采样率任何输入内部重采样至24 kHz → 44,100 Hz输出显著优势44.1 kHz高质量输出冻结的DAC解码器合成全频带音频8 kHz以上的嘶嘶声和“空气感”得以再生而非简单传递。从零开始训练无需预训练语音骨干网络发布的检查点仅需63 GPU小时的训练时间。内容衡量精准除了DNSMOS指标外针对真实转录本的CER字符错误率是衡量内容保留的必要指标确保修复后的语音不仅听起来清晰内容也准确。校准退化处理输入来自DSP增强器其编解码器调色板针对每个样本进行拟合以适应真实的退化语音分布而非随机效果的组合。实际修复效果与基准测试听觉体验提升通过实际的受损语音样本修复DIAMOND在DNSMOS-P.835 OVRL指标上每段音频都提升了超过一个点即使不使用耳机也能明显感受到差异。例如#退化输入修复后 - 44.1 kHzDNSMOS OVRL1samples/example1_degraded.wavsamples/example1_restored.wav2.16 → 3.50 (1.34)2samples/example2_degraded.wavsamples/example2_restored.wav2.83 → 3.59 (0.76)3samples/example3_degraded.wavsamples/example3_restored.wav2.56 → 3.65 (1.10)4samples/example4_degraded.wavsamples/example4_restored.wav3.32 → 3.89 (0.57)基准测试表现在750个真实退化录音上的测试显示DIAMOND在感知质量方面排名第二超过了RE-USE等模型尽管其训练数据量约为RE-USE的四分之一。在内容保留方面作为自回归系统DIAMOND的CER字符错误率表现合理与其他自回归系统如UniSE相当表明性能差距源于自回归解码固有的暴露偏差而非容量限制。适用场景与注意事项适用场景DIAMOND特别适用于离线修复和数据集清理任务能够将大量退化录音播客、访谈、档案和经过有损编解码器处理的用户生成音频转化为足够干净的材料用于训练其他语音模型。注意事项CER尾部风险作为自回归解码器DIAMOND在困难片段上偶尔会出现单词模糊的情况。推理时的安全措施分块解码、重复惩罚可降低风险但在内容保真度至关重要时仍需检查转录本。非实时解码解码过程是串行的每秒音频需要处理86帧加上深度处理因此这是离线修复而非实时过滤。英语为中心训练数据为英语其他语言未经测试。生成式修复编解码器截止频率以上的内容是根据上下文生成的具有合理性但并非真实恢复。因此不要将输出视为所说内容的法医证据。负责任地使用修复后的语音是合成语音。不要将其呈现为未更改的录音也不要用它来伪造或错误归因某人的言论。总结DIAMOND通过创新的双Transformer架构即时间Transformer和深度Transformer的协同工作在语音修复领域取得了显著成就。它能够将受损音频恢复至44.1 kHz的高质量水平为语音数据处理和修复提供了强大的工具。尽管存在一些局限性但其在离线修复和数据集清理等场景下的应用价值不可忽视为相关领域的发展注入了新的活力。相关资源技术报告TECH_REPORT.pdf模型权重diamond.safetensors配置文件diamond.json【免费下载链接】diamond-1.0项目地址: https://ai.gitcode.com/hf_mirrors/nineninesix/diamond-1.0创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考