视觉语境能否提高具有体现特征的智能体自动语音识别的性能？

EMNLPOct, 2022

视觉语境能否提高具有体现特征的智能体自动语音识别的性能？

Can Visual Context Improve Automatic Speech Recognition for an Embodied Agent?

Pradip Pramanick, Chayan Sarkar

TL;DR本文介绍了一种利用视觉信息，通过新的解码器偏置技术将机器人的语音识别能力改进来识别含有可见实体描述的口语，以提高自动语音识别系统在机器人上的鲁棒性能，并取得了 %59 的相对错误率降低。

Abstract

The usage of automatic speech recognition (asr) systems are becoming omnipresent ranging from personal assistant to chatbots, home, and industrial automation systems, etc. Modern →

automatic speech recognition asr robots visual context decoder biasing

发现论文，激发创造

语言引导的具身化智能体多模式语音识别

本文提出了一种多模式自动语音识别模型，通过考虑附带的视觉上下文来减少口头指令的错误转录，使用了仿真的噪声环境。实验结果表明，使用多模态 ASR 模型可使任务完成的准确性得到提高。

Feb, 2023

看能增强听：使用图像恢复丢失的语音

本研究探讨了利用图像确立语音识别模型中文字的语义含义，以减少噪音干扰并提高模型鲁棒性的方法。实验结果表明整合视觉信息可以显著提高模型性能，增强语音信号对语音识别的帮助

Feb, 2020

通过学习音频 - 文本跨模态上下文表示实现会话语音识别

通过引入跨模态对话表示，结合预训练的语音和文本模型，扩展 Conformer 编码器 - 解码器模型，我们的方法能够提取更丰富的历史语音上下文，实现较标准 Conformer 模型相对准确度提升 8.8%（HKUST）和 23%（MagicData-RAMC）的结果。

Oct, 2023

听觉、视觉与思考：基于预训练的文本 - 视频表示的视觉上下文感知语音识别

本研究致力于解决利用视觉信号来提高语音识别（ASR）的问题，探讨了一种基于自监督预训练的文本视频嵌入模型的视觉上下文感知 ASR 方法，该方法包括多流注意力结构和熟思（deliberation）模型，利用视觉信息的熟思模型比多流模型在干扰噪声下提高了语音识别正确率和恢复被屏蔽单词的准确率。

Nov, 2020

ViLaS: 将视觉和语言集成到自动语音识别中

提出一种多模态自动语音识别模型（ViLaS），能够同时或分别集成视觉和语言线索来帮助识别输入语音，提出一种训练策略，从而提高在模态不完整的测试场景中的性能，并创建一个包含视觉和语言线索的多模态 ASR 数据集（VSDial），探索融合视觉和语言的效果。在 Flickr8K 和自构架构的 VSDial 数据集上进行实证结果报告，调查跨模态融合方案，并对 VSDial 上的细粒度跨模态对齐进行分析。

May, 2023

序列到序列语音识别的多模态基础

本研究提出了基于多模态的端到端自适应语音识别系统，采用卷积神经网络获取视觉信息，与传统方法相比表现优越。

Nov, 2018

鲁棒性自监督视听语音识别

本文提出了一个基于 AV-HuBERT 模型的自监督音视频言语识别框架，利用 LRS3 数据集的少量标记数据，在噪音干扰的情况下提高了超过 50% 的性能，并且比基于音频的模型将词错误率减少了 75% 以上。

Jan, 2022

对话语言的自动语音识别系统评估：语言学视角

本文以法语为案例研究，从语言学的角度探讨自动语音识别系统在复杂语境下的识别准确度，并解决了法语同音词的歧义问题，提高了法语语音转写准确度。

Nov, 2022

虚拟助手的辨别式实体感知语言模型

本文研究提出了一种基于知识图谱的语言建模方法，通过有效的格栅重排过程，达到了相对句子错误率的降低，为虚拟助手 ASR 的精度提高提供了强有力的支持。

Jun, 2021

多模式语音识别及非结构化语音掩蔽

本篇论文研究了在嘈杂的情况下，如何通过视觉上下文提升语音识别的准确性，并通过模拟 RandWordMask 掩码模式验证了多模态 ASR 系统在不同掩码模式下的泛化能力，结论显示在一定程度上可提升 ASR 系统的能力。

Oct, 2020