Mar, 2022

VoViT: 基于图论的低延迟音视频语音分离Transformer

TL;DR本文提出了一种音频-视觉声音分离方案,在两种不同场景(语音和唱歌)中实现了低时延的最新成果。该模型基于两级网络,采用轻量级图卷积网络从面部标记中提取运动线索,然后将视觉和音频特征输入到音频-视觉转换器中,为目标源的隔离估计提供相当不错的结果。在第二阶段,利用音频网络增强了主要的声音。我们进行了不同的消融研究和与最先进的方法比较。最后,我们探讨了在唱声分离任务中训练语音分离模型的可转移性。