打通目标与图像级别表示以实现开放词汇检测

Jul, 2022

打通目标与图像级别表示以实现开放词汇检测

Bridging the Gap between Object and Image-level Representations for Open-Vocabulary Detection

Hanoona Rasheed, Muhammad Maaz, Muhammad Uzair Khattak, Salman Khan, Fahad Shahbaz Khan

TL;DR本文提出了一种基于CLIP模型和图像水平监督的对象中心对齐的方法，运用伪标注实现高质量对象提议并在训练过程中扩展词汇表，通过新的权重传递函数将两种对象对齐策略结合，实现了在OVD方案中对象和图像中心表示的最小化差距。在COCO数据集上，我们的方法在新颖类别上取得了36.6的AP50表现，绝对值超过了以前的最佳性能。对于LVIS，我们在罕见类别上超越了最新的ViLD模型达5.0的掩膜AP，总体提高3.4。

Abstract

Existing open-vocabulary object detectors typically enlarge their vocabulary sizes by leveraging different forms of weak supervision. This helps generalize to novel objects at inference. Two popular forms of weak-superv

发现论文，激发创造

使用字幕的开放词汇物体检测

本文提出了一种称为开放词汇物体检测的新型物体检测问题，利用有限数量的物体分类边界框注释和图像-标题对来训练物体检测器，可以在更低的成本下覆盖更广泛的物体范围，成功地解决了物体检测中监督要求高的问题，并且更具实用性和效率，可以检测和定位那些未在训练过程中提供边界框注释的物体，无监督和零样本方法都无法做到如此高的准确性。

Nov, 2020

开放词汇目标检测的学习目标语言对齐

提出了一种使用自然语言监督学习从配对的图像文本数据中直接学习的新型开放词汇目标检测框架，通过将对象-语言对齐形式化为一个图像区域特征集合和一个词向量集合之间的集合匹配问题，可以更简单和有效地在图像-文本对上训练开放词汇对象探测器，并在两个基准数据集上进行了广泛的实验，在LVIS等新类别上实现了32.0％的mAP和21.7％的掩膜mAP等卓越性能。

Nov, 2022

CORA：使用区域提示和锚点预匹配来适应开放词汇检测的 CLIP 模型

利用Region prompting和Anchor pre-matching实现CLIP适应开放词汇检测任务，成功应用于目标检测并在评估中超越以前的最佳性能。

Mar, 2023

开放词汇物体检测的多模式分类器

本文旨在进行无遮挡多类目标检测的研究，探索使用语言描述、图像样例或两者的组合来指定新颖类别的三种方式，研究者通过采用大型语言模型来生成信息化的语言描述，基于图像样例提供了视觉聚合器，并提出了将语言描述和图像样例信息融合的多模态分类器方法。实验表明，本文提出的基于文本的分类器优于之前OVOD方案，基于视觉的分类器表现与文本分类器表现相当，而使用多模态分类器比任一模态更好。

Jun, 2023

开放词汇检测和分割综述：过去、现在和未来

计算机视觉中的目标检测和分割作为最基本的任务，在深度学习时代取得了巨大的进展。然而，由于昂贵的手动标注，现有数据集中的标注类别往往规模较小且预定义，即最先进的检测器和分割器无法推广到开放词汇之外。因此，近年来越来越多的关注集中在开放词汇检测（OVD）和分割（OVS）上。在本调研中，我们提供了对过去和最新OVD和OVS发展的全面审查。为此，我们根据任务类型和方法学开发了一个分类法。我们发现，对于不同的方法学，包括：视觉-语义空间映射、新颖的视觉特征合成、区域感知训练、伪标签、基于知识蒸馏和基于迁移学习的方法，弱监督信号的许可和使用可以很好地区分。所提出的分类法在不同任务之间是通用的，包括目标检测、语义/实例/全景分割、三维场景和视频理解。在每个类别中，详细讨论了其主要原则、关键挑战、发展路线、优点和缺点。此外，我们还对每个方法的关键组成部分进行了基准测试。最后，我们提供了一些有前途的方向，以激发未来的研究。

Jul, 2023

好的开放式字词探测器的要素: 一个拆解的视角

开放词汇检测（OVD）是一种新的目标检测范式，旨在定位和识别由不受限词汇定义的未知对象。本文提出了三种OVD方法，并通过实验验证了这些方法在不同设置下的性能。其中，DRR方法在OVD-COCO基准测试中取得了最佳表现，并相对于先前最先进水平获得了2.8的AP$_{50}$绝对增益。

Sep, 2023

EdaDet: 使用早期密集对齐的开放性词汇目标检测

通过充分利用细粒度本地图像语义并使用早期稠密对齐（EDA）方法，我们提出了一种新的视觉-语言模型来改进开放词汇的目标检测，相较于现有方法，我们的方法在严格的设置下表现出更好的性能，无需使用外部训练资源，例如在COCO数据集上将新类别的box AP50提高了8.4％，在LVIS数据集上将稀有mask AP提高了3.9%。

Sep, 2023

面向检测的图像-文本预训练的开放词汇测量

基于检测导向的图像-文本预训练的新的开放词汇检测方法用于填补图像级预训练和开放词汇对象检测之间的差距，通过使探测器头从嘈杂的图像-文本对中学习，我们的方法能够利用对比损失学习到新出现的对象-语义线索，在LVIS和COCO基准测试中均获得了非常有竞争力的结果，并在转移检测设置中显著优于基线。

Sep, 2023

用于开放式物体检测的生成式区域语言预训练

生成式开放式物体检测是一种更通用、实用的问题，本论文提出了一个名为GenerateU的简单框架，将物体检测作为一个生成问题，可以以自由形式检测密集物体并生成它们的名称，通过广泛的实验验证了GenerateU的强大的零样本检测性能。

Mar, 2024

通过相邻区域注意力对齐进行开放式目标检测

提出了一种邻近区域注意力对齐的方法，通过在一组邻近区域的注意力机制内进行对齐来提升开放词汇推理，进而协助检测器和预训练视觉语言模型之间的对齐，在开放词汇基准测试中展现出优秀的性能。

May, 2024