MLLM作为视频叙述者：减轻视频片段检索中的模态不平衡

Jun, 2024

MLLM作为视频叙述者：减轻视频片段检索中的模态不平衡

MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval

Weitong Cai, Jiabo Huang, Shaogang Gong, Hailin Jin, Yang Liu

TL;DR利用多模态大型语言模型(MLLM)的视觉文本理解能力，本研究以MLLM作为视频的叙述者，生成视频的文本描述，从而减少模态不平衡并提高时间定位的准确性。通过获取视频每个时间戳的文本叙述并构建带有时间信息的结构化文本段落，与视觉内容进行时间对齐。然后，将时间感知的叙述和相应的视频时间特征进行跨模态特征融合，生成语义增强的视频表示序列用于查询定位。接下来，引入了一种单模态的叙述-查询匹配机制，鼓励模型从上下文连贯的描述中提取互补信息，以改善检索效果。该方法在两个基准测试上进行了广泛实验，证明了其有效性和普适性。

Abstract

video moment retrieval (VMR) aims to localize a specific temporal segment within an untrimmed long video given a natural language query. Existing methods often suffer from inadequate training annotations, i.e., the sentence typically matches with a fraction of the prominent video conte

发现论文，激发创造

VLANet: 弱监督视频时刻检索的视频-语言对齐网络

本文提出了一种弱监督方法（wVMR）进行视频瞬间检索，通过使用对齐网络实现了更清晰的注意力和更少的计算负荷，并使用对比学习来训练模型。

Aug, 2020

对比学习视频语料库瞬间检索

本文提出了一个可用于视频语料库时刻检索的检索和定位网络，采用对比学习优化视频编码器和文本编码器，从而实现视频轮廓时序信息检索。该方法效率高且具有可比性。

May, 2021

视频时刻检索的多模态跨域对齐网络

本文提出了一种用于跨域视频时刻检索的 Multi-Modal Cross-Domain Alignment 网络以及三个模块：域对齐模块、跨模态对齐模块和特定对齐模块，通过联合训练这些模块，实现域内不变和语义对齐的跨模态表示。

Sep, 2022

面向模态的视频语料库时刻检索的伪查询生成

本文提出了一种基于自监督学习的框架，通过生成基于视觉和文本信息的伪查询，利用多模式信息来定位视频片段，有效地解决了视频中存在的时序动态和多模式推理问题，并在实验中取得了竞争性的结果。

Oct, 2022

通向可泛化的视频片段检索：通过将视觉动态注入到图像-文本预训练中实现

研究探究了大规模图文数据中的多模态相关性，并提出了一种通用方法Visual-Dynamic Injection（VDI）来增强模型对视频时刻的理解及视觉动态信息的提取，从而更准确地进行视频-文本对齐，该方法在现有VMR方法的基础上取得了显著的进展。

Feb, 2023

克服视觉和文本之间的弱对齐性以实现视频时刻检索

提出一种名为BM-DETR的背景感知时刻检测变压器模型，通过利用负查询和周围的背景来考虑相关性并提高时刻灵敏度，从而提高视频时刻检索（VMR）的效果和泛化能力。

Jun, 2023

迈向平衡对齐：视频时刻检索的模态增强语义建模

通过提升视频模态和文本模态的特征，Modal-Enhanced Semantic Modeling（MESM）框架在视频短片检索中实现了更平衡的对齐，填补了形式上不平衡的模态差距。实验证明该框架在多个基准测试上取得了显著的泛化能力和最佳效果。

Dec, 2023

提升视频语料库时刻检索的部分相关性增强

视频语料库时刻检索~(VCMR)是一项新的视频检索任务，旨在使用自然语言文本作为查询从大量未修剪的视频语料库中检索相关时刻。我们提出了一种提高VCMR的部分相关性增强模型~(PREM)，该模型通过专门的部分相关性增强策略，在视频检索和时刻定位两个子任务中取得了更好的性能。实验结果表明，该模型优于基准模型，在VCMR任务中达到了最新的性能水平。

Feb, 2024

基于大型语言模型的上下文增强视频片段检索

通过引入大型语言模型（LLMs）的广泛知识，我们提出了一种大型语言模型引导的时刻检索（LMR）方法，以改善视频上下文表示和跨模态对齐，从而实现准确的目标时刻定位。

May, 2024

多模态大型语言模型对视频片段检索的惊人有效性

利用图像-文本预训练的多模态大语言模型（MLLMs）进行时刻检索，获得了令人惊讶的有效性，并且在时刻检索和时序动作定位任务上实现了最新的性能。

Jun, 2024