文本到图像检索的跨模态一致性

AAAISep, 2021

Cross-Modal Coherence for Text-to-Image Retrieval

Malihe Alikhani, Fangda Han, Hareesh Ravi, Mubbasir Kapadia, Vladimir Pavlovic...

TL;DR本文提出了一种跨模态相依的一致性模型，用于提高现有联合理解模型的性能，结果展示出使用相依性理念的模型能够更好地检索与目标文本相关的图像，这对不同模态间的沟通及在捕获文本与图像常识推理中相依性关系的角色具有重要的研究意义。

Abstract

Common image-text joint understanding techniques presume that images and the associated text can universally be characterized by a single implicit model. However, co-occurring images and text can be related in qualitatively different ways, and explicitly modeling it could improve the p

image-text joint understanding cross-modal coherence model text-to-image retrieval coherence relations commonsense inferences

发现论文，激发创造

跨模态统一建模技术用于字幕生成

该论文利用与计算模型相关的连贯性关系研究了图像字幕生成的信息需求和目标，通过特定的协议，获取 10,000 个图像与字幕的连贯性关系，将其用于学习推理的新任务，得到的结果显示，通过连贯性关系提高了生成的字幕的一致性和质量。

May, 2020

重新审视跨模态检索

本文提出了一种交叉模态检索系统，利用图像和文本编码，实现了同时检索模态的功能，避免了需要为每个模态使用不同网络的缺点。在所使用的知识中，本文是第一篇采用单一网络和融合的图像 - 文本嵌入进行跨模态检索的工作。在 MS-COCO 和 Flickr30K 两个著名的多模态数据集上对该方法进行了评估。

Jul, 2018

理解、分类和预测语义图像 - 文本关系

本文借鉴视觉传达研究，探究了多模式信息检索的有用语义图像 - 文本关系，在自动收集和扩充数据资源的基础上，采用深度学习系统和三种度量标准（跨模态互信息、语义相关性和图像与文本的状态关系）对八种语义图像 - 文本类别进行了预测，并在一个严格的测试集上展示了该方法的可行性。

Jun, 2019

保持语义领域对稳健跨模态检索的影响

本篇研究提出了一种方法，使用特定的 loss 函数，在保持图像和文本子空间内的语义连贯性的同时鼓励它们之间的语义协同，并改进了基线模型，以实现跨模态检索。

Jul, 2020

通过生成模型改进文本 - 视觉交叉检索：观察、想象和匹配

本文提出一种新的跨模态检索方法，利用生成式模型学习多模态数据的全局和本地特征，从而在 MSCOCO 数据集上实现了最先进的跨模态检索结果。

Nov, 2017

烹饪情境下的跨模态检索：学习语义文本 - 图像嵌入

本文提出了一种跨模态检索模型，采用视觉和文本数据对餐品及其食谱进行建模，并在包含近 100 万图像配方对的 Recipe1M 数据集上进行了验证，取得了比先前最先进模型更好的效果，并针对计算烹饪应用案例展示了质量结果。

Apr, 2018

跨模态协调：在多元输入模态中的协同

提出两种不同的方法来解决跨模态检索的问题，一种基于 CLIP 对任意数量的输入模式进行扩展，而第二种方法通过回归跨模态相似性来解决协调问题，并在多个数据集上进行实验证明其简单有效，并允许以新的方式解决检索问题。

Jan, 2024

快速检索、智能重新排名：协作和联合方法改进跨模态检索

本文提出了一种基于 fine-tuning 的框架，将任何预先训练的文本 - 图像多模态模型转换为高效的检索模型，并通过 cooperative retrieve-and-rerank 方法结合双网络和交叉编码器，实现更准确、更高效的跨模态检索。

Mar, 2021

高效的令牌引导下的图像文本检索与一致多模态对比性训练

本文提出了一种基于 Token-Guided Dual Transformer (TGDT) architecture 的图像文本检索框架，将粗粒度和细粒度表示学习结合到一个统一的框架中，并提出了一种名为同步多模态对比损失的新型训练目标，通过混合全局和本地跨模态相似性的两个阶段的推理方法，实现了与代表性最新方法相比极低的推理时间下，实现了最先进的检索表现。

Jun, 2023

通过多模态蕴含修订图像 - 文本检索

本论文提出了一种多模态蕴含分类器来确定图像的语句，以及开发了一种通用可调节学习速率策略来教授一个检索模型区分这些蕴含的语句和其他负样本。在实验中，我们手动注释了一个蕴含更正的图像文本检索数据集用于评估。结果表明，所提出的蕴含分类器达到了约 78% 的准确度，并持续提高了图像文本检索基线的性能。

Aug, 2022