Jun, 2024

预训练特征引导扩散模型用于语音增强

TL;DR通过整合频谱特征到变分自编码器(VAE)中,并在反向过程中利用预训练特征进行引导,结合确定性离散积分方法(DDIM)来简化抽样步骤,我们的模型提高了效率和语音增强质量,同时在两个不同信噪比的公共数据集上展示出最先进的结果,超越了其他基线方法在效率和稳健性方面。所提出的方法不仅优化了性能,还增强了实际部署能力,而不增加计算需求。