MLCA-AVSR：基于多层交叉注意力融合的音视频语音识别

Jan, 2024

MLCA-AVSR：基于多层交叉注意力融合的音视频语音识别

MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition

He Wang, Pengcheng Guo, Pan Zhou, Lei Xie

TL;DR提出了一种多层交叉注意力融合的视听语音识别方法，通过在不同的音频 / 视觉编码器层级融合各种模态，实现了每种模态的表示学习，实验结果表明该方法在 MISP2022-AVSR 挑战数据集上达到了新的拼接最小排列字符错误率 (cpCER) 为 30.57% 的性能，并相对于前期系统获得了最多 3.17% 的相对改进，同时超过了第一名系统，获得了该数据集上的新的最先进 cpCER 为 29.13%。

Abstract

While automatic speech recognition (ASR) systems degrade significantly in noisy environments, audio-visual speech recognition (AVSR) systems aim to complement the audio stream with noise-invariant visual cues and

automatic speech recognition audio-visual speech recognition modality feature learning representation learning cross-attention fusion

发现论文，激发创造

端到端音视频语音识别的模态注意力

该研究提出了一种基于多模态注意力的音视频语音识别方法，该方法使用了最先进的 Seq2seq 架构，基于它们的重要性自动学习了来自两种模态的混合表示，并在不同信噪比下相对于单独的音频模态获得了 2% 到 36% 的提高，相比传统的特征级联方法，在清洁和嘈杂的条件下均能获得更好的识别性能，可以轻松地推广到其他多模态任务中。

Nov, 2018

跨模态全局交互与局部对齐的视听语音识别

本文提出了一种跨模态全局交互和局部对齐 (GILA) 方法，从全局和局部角度捕捉音频 - 视觉 (A-V) 间的深层相关性，用于改善音频 - 视觉语音识别中的多模态表示，实验结果表明我们的方法优于现有的有监督学习方法。

May, 2023

鲁棒性自监督视听语音识别

本文提出了一个基于 AV-HuBERT 模型的自监督音视频言语识别框架，利用 LRS3 数据集的少量标记数据，在噪音干扰的情况下提高了超过 50% 的性能，并且比基于音频的模型将词错误率减少了 75% 以上。

Jan, 2022

混合 CTC/RNN-T 快速 Conformer 的多语言视听语音识别

通过引入多语种音视频语音识别模型和快速调整器模型，提高了模型性能和音频噪音稳健性。在多语种数据集上进行训练，达到了领先水平，并在 MuAViC 基准测试中显著减少了平均识别错误率。

Mar, 2024

通过强化学习利用语言和视觉的模态特定表征进行音视频语音识别

我们提出了一个基于强化学习的框架（MSRL），动态地协调模态不变和模态特异性的表示，从而稳定地提供互补信息，用于音视频语音识别任务，实验结果表明，此方法在 LRS3 数据集中取得了最新的成果。

Dec, 2022

基于视觉感知的音频特征增强，用于稳健的端对端音视频语音识别

本文提出了一种噪声强韧的端到端的视听语音识别系统，其中使用视觉背景驱动音频特征增强模块（V-CAFE）通过考虑所获得的视觉背景来生成噪声降低掩模，进而提升音频特征，结合 Conformer 和 Transformer 模型进一步提高了噪声稳健性，并在大型视听数据集 LRS2 和 LRS3 上进行了实验验证。

Jul, 2022

AV-CPL: 面向音视频语音识别的连续伪标记

通过连续的伪标签生成解决了音频 - 视觉语音识别的半监督训练问题，同时提高了视觉语音识别性能并保持了实用性。

Sep, 2023

通过唇语子词相关性进行视觉预训练和交叉模态融合编码的提高音频视觉语音识别

本文提出了两种新技术来改善音视频语音识别，通过利用口型和音节级次字单元之间的相关性来建立良好的帧级音节边界并实现准确定位，以及利用音频引导的跨模态融合编码器神经网络来充分利用模态互补性。实验结果表明，使用相对较少的训练数据，该系统比复杂的前端和后端现有系统取得更好的性能。

Aug, 2023

LRS2 数据集中重叠语音的音视频识别

本研究探讨了利用视听技术识别重叠的语音信息的三个问题，包括基本体系结构设计，模态融合的建议设计门，以及通过优化的统一的方法来建立 AVSR 系统。实验结果表明，该系统在 LRS2 数据集上的性能超过了传统的语音分离和识别组件的流水线架构，可获得相对于仅音频的基线 LF-MMI DNN 系统高达 29.98% 的字错误率（WER）降低，而采用特征融合技术的 AVSR 系统相对于基准系统进一步提高了 4.89% 的 WER 降低。

Jan, 2020

深度多模态学习用于音视频语音识别

本文介绍深度多模态学习的方法，用于合并语音和视觉特征进行音视频自动语音识别。实验结果表明，使用深度网络的融合模型和双线性 softmax 层能够进一步降低电话错误率。

Jan, 2015