Oct, 2023

端到端多通道说话人归属 ASR:说话人指导解码器与输入特征分析

TL;DR我们提出了一种端到端的多通道说话人归属自动语音识别系统(MC-SA-ASR),它将基于 Conformer 的编码器与多帧跨通道注意力和基于说话人归属的 Transformer 解码器相结合。据我们所知,这是第一个在多通道环境中高效集成 ASR 和说话人识别模块的模型。在 LibriSpeech 数据的模拟混合语音中,与之前提出的单通道和多通道方法相比,我们的系统将词错误率(WER)相对降低了 12% 和 16%。此外,我们还研究了不同输入特征(包括多通道幅度和相位信息)对 ASR 性能的影响。最后,我们在 AMI 语料库上对我们的系统进行了实验,确认了我们系统在真实多通道会议转录中的有效性。