一种统一的模型？走向端到端的联合说话人分离与语音识别

Oct, 2023

一种统一的模型？走向端到端的联合说话人分离与语音识别

One model to rule them all ? Towards End-to-End Joint Speaker Diarization and Speech Recognition

Samuele Cornell, Jee-weon Jung, Shinji Watanabe, Stefano Squartini

TL;DR这篇论文提出了一个名为 SLIDAR（滑动窗口判别增强识别）的新颖框架，用于联合演讲者判别和自动语音识别，能够处理任意长度的输入和任意数量的说话人，通过滑动窗口方法实时给出窗口内的转录、判别和说话人嵌入，并通过聚类说话人嵌入获得全局演讲者身份，实验证实了该方法在近距离和远场语音场景中的有效性。

Abstract

This paper presents a novel framework for joint speaker diarization (SD) and automatic speech recognition (ASR), named slidar (sliding-win

speaker diarization automatic speech recognition slidar end-to-end diarization-augmented speech transcription encoder-decoder architecture

发现论文，激发创造

基于 ASR 的端到端神经化分离

本文提出基于 Conformer 的端到端神经口头日记（EEND）模型，该模型利用从自动语音识别（ASR）模型导出的语音输入和特征。通过将 ASR 特征与声学特征相结合，采用新的自注意力机制来建立鲁棒的说话人表示，并使用多任务学习来最小化 ASR 特征的分类损失和日记化损失，将其应用于 Switchboard+SRE 数据集上的两个讲话人英语对话中，相对于基线，利用 ASR 特征的多任务学习最有效，在词汇位置信息下将 DER 降低了 20％。

Feb, 2022

使用令牌级别的说话人嵌入进行分配流式讲话者自动语音识别

提出了一种基于 token 级别序列化输出训练 (t-SOT) 的流式说话者归属性自动语音识别 (SA-ASR) 模型，该模型可以在多人同时说话时实现低延迟的 “谁说了什么” 的识别，并提出了一种基于编码 - 解码的说话者嵌入提取器，可以从非重叠语音和重叠语音中为每个识别的令牌估计说话者表示。

Mar, 2022

使用旁路分离器进行多说话人重叠语音识别和说话人分离的统一建模

通过在单输出识别（ASR）模型中插入侧耳声分离器，结合说话人分离（diarization）任务，提出了一种能够同时定位多个讲话者的多讲话人重叠语音识别语音模型。

May, 2023

走向真实场景的端到端演讲者分离

本文提出了一种吸引子模型的端到端系统，通过训练模拟数据集来适应于野外含有更多发言者的情况，并且使用注意力机制增强网络容量来识别更多的发言者吸引子。虽然这种模型只是基于音频的，但是在 AVA-AVD 基准数据集中取得了明显优于只有音频或音视频有关的基线模型的破纪录成果，将分离误差绝对值减少了 23.3%。

Nov, 2022

基于辅助网络的面向单词级端到端神经说话者日志线任务

我们提出了具有辅助网络的 Word 级端到端神经化登记（WEEND），这是一种多任务学习算法，能够在相同的神经架构中同时执行端到端自动语音识别（ASR）和说话人登记。实验结果表明，WEEND 在所有 2 个说话人短格式场景上优于基线系统，并且具有推广到 5 分钟音频长度的能力。尽管 3 个或更多说话人的对话更困难，但我们发现通过足够的领域内训练数据，WEEND 有潜力提供高质量的登记文本。

Sep, 2023

基于编码器 - 解码器吸引子的未知数量说话者端到端分离

该论文提出了一种基于编码器 - 解码器的吸引因子计算方法，该方法可灵活地生成不同数量的吸引因子，用以支持不同数量的说话人，并利用传统的自我注意力端到端神经说话人分离网络（SA-EEND）来提取讲话嵌入序列和生成说话人活动，实验结果表明，相对于传统的基于聚类的说话人分离模型和端到端模型，该方法分别在模拟的双说话人条件和未知说话人数量的条件下都取得了更好的说话人分离性能。

May, 2020

词汇发音者错误更正：利用语言模型进行发音者离话错误更正

本篇论文探讨了使用语言模型的 Speaker diarization second-pass error correction approach 引入词汇信息，可以有效且稳健地提高多个电话数据集上的单词级别 Diarization 错误率（WDER）降低 15％至 30％。

Jun, 2023

探索口语理解中有关说话人信息以改进说话人分离

本文介绍了一种从多方会议的语义内容中提取与讲话者相关信息进而改进说话人分离方法的方法，提出了两个子任务（对话检测和发言者切换检测）来有效地从对话语义中提取讲话者信息，并提出了一种简单而有效的算法来联合建模声学和语义信息并获得标识讲话者的文本。实验结果表明，我们的方法在 AISHELL-4 和 AliMeeting 数据集上相对于仅声学的说话人分离系统都有显著的改进。

May, 2023

混合编码器用于语音分离和识别

该论文提出了一种基于中间地带的方法来处理多说话者语音识别，该方法既利用了情感识别模块类似于模块化方法的显式语音分离技术，又将混合语音信息直接纳入 ASR 模块，以减轻语音分离器所产生的错误传播，并且通过结合个体说话者信息的层来交换跨说话者的上下文信息。

Jun, 2023

说话人感知语音转换器

本研究利用 Speech-Transformer (SST) 研究 E2E 模型的说话人感知训练，提出了一个 Speaker-Aware Speech-Transformer (SAST) 模型，在静态的说话人知识块基础上生成加权的说话人嵌入向量，成功地将训练说话人的因素规范化，相较于独立于某个特定训练说话人的 baseline 模型，SAST 取得了相对 6.5% 的 CER 减少。

Jan, 2020