Zero and R2D2: 一个大规模的中文跨模态基准和视觉语言框架

May, 2022

Zero and R2D2: 一个大规模的中文跨模态基准和视觉语言框架

Zero and R2D2: A Large-scale Chinese Cross-modal Benchmark and A Vision-Language Framework

Chunyu Xie, Jincheng Li, Heng Cai, Fanjing Kong, Xiaoyu Wu...

TL;DR该研究报告介绍了一个面向中文语料库的大规模高质量跨模态基准（ZERO），该基准包含了最大的公共预训练数据集 ZERO-Corpus 和用于下游任务的五个人工注释微调数据集，并且提出了一个基于预排序和排序机制的 VLP 框架（R2D2），该框架采用目标导向蒸馏和特征导向蒸馏技术，用于实现大规模跨模态学习，并在图像 - 文本检索、文本 - 图像匹配、图像字幕生成、文本到图像生成和零样本图像分类等五个范畴的任务上实现了最先进的表现。

Abstract

vision-language pre-training (VLP) on large-scale datasets has shown premier performance on various downstream tasks. In contrast to plenty of available benchmarks with English corpus, large-scale pre-training datasets and downstream datasets with →

vision-language pre-training chinese corpus benchmark vlp framework cross-modal learning

发现论文，激发创造

悟空：一个亿级中文跨模态预训练基准

本文发布了一个名为 Wukong 的大规模中文跨模态数据集，旨在用于不同模态的预训练方法基准测试以促进 VLP 研究和社区发展，并通过扩展实验以及不同下游任务的基准测试验证了该数据集的有效性。

Feb, 2022

零样本跨语言图像检索

该论文介绍了一种使用跨语言预训练进行零 - shot 学习的多模式语言和视觉问题解决方法，它可以用于构建跨语言图像检索模型和改进文本嵌入聚类，并在多语言环境下进行评估。

Nov, 2020

零样本跨语言图像检索与标记

本论文探讨采用跨语言预训练的零样本方法来学习多模态表示，提出建立跨语言图像检索模型的简单实用方法，并引入了一种新的目标函数来测试多语言 MSCOCO2014 字幕测试数据集（XTD10）的零样本模型性能，证明跨语言模型可用于零样本的下游任务，如多语言图像标记。

Sep, 2021

WuDaoMM：大规模多模态数据集用于预训练模型

本篇论文介绍了一种大规模多模态库 WuDaoMM 用于 Vision-Language 解决方案的预训练模型，其中包含了超过 650M 的弱相关和强相关的图片 - 文本对，并经过实验证明，WuDaoMM 是一种高效的 VLPMs 数据集。

Mar, 2022

中文 CLIP：中文对比视觉 - 语言预训练

该研究使用中文数据构建巨大的图像文本配对数据集，并使用其预训练中文 CLIP 模型，该模型能够在零 - shot 学习和微调设置下，在 MUGE、Flickr30K-CN 和 COCO-CN 上实现最新技术水平，并能够在 ELEVATER 基准测试中实现竞争性能。

Nov, 2022

Yuan 1.0：零样本学习和少样本学习中的大规模预训练语言模型

本研究提出了一种方法，将分布式训练性能纳入模型架构设计中，用于构建 245B 参数的大型单例语言模型 Yuan 1.0，在千万台 GPU 上取得了优异的性能，并在自然语言处理任务中取得了最新成果，同时还建立了当前质量最高的 5TB 中文语料库。此外，本研究还提出了数据处理方法和校准与标签扩展方法，以提高零样本和少样本准确性。Yuan 1.0 表现出强大的自然语言生成能力，其生成的文章很难与人类撰写的文章区分开来。

Oct, 2021

受限资源下的对比视觉 - 语言预训练

本文提出了一种可在有限资源下进行双编码器多模态表示对齐的新方法，并证明该算法在大规模数据上的有效性。

Dec, 2021

WenLan：大规模多模态预训练桥接视觉和语言

本文介绍了作者团队领导的 “文兰” 项目的主要研究方向，即通过两个塔的 BriVL 预训练模型和跨模态对比学习框架的先进算法，隐式地建模跨模态关联，从而更成功地实现大规模多模态预训练。同时，他们还建立了一个大规模的中文多源图像文本语料库，称为 RUC-CAS-WenLan，用于 BriVL 模型的预训练。实验结果表明，预训练的 BriVL 模型在各种下游任务中的性能优于 UNITER 和 OpenAI CLIP。

Mar, 2021

RS5M：一种用于遥感视觉语言的大规模数据集和基础模型

本文提出了一种新的框架，包括领域基础模型（DFM），该模型缩小了通用基础模型（GFM）和特定领域下游任务之间的差距，并通过预训练的 VLM 将筛选后的遥感图像与英文描述进行配对，构成了第一个大规模遥感图像 - 文本匹配数据集。在该数据集上的实验结果表明，使用上述数据集和提出的 DFM 方法的零样本分类和视觉语言检索任务的性能都较好，并且 RS Stable Diffusion 模型的训练也取得了成功的结果。

Jun, 2023

M6：一个中文多模态预训练模型

本研究构建了最大的中文多模态预训练数据集，提出了一个跨模态预训练方法 M6，并在众多应用领域中展示了其优异性能和高质量图像生成能力。

Mar, 2021