通过困惑度估计污染情况：量化语言模型评估中的记忆效应

Sep, 2023

通过困惑度估计污染情况：量化语言模型评估中的记忆效应

Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation

Yucheng Li

TL;DR最近的研究显示在大规模语言模型的训练语料中普遍存在数据污染问题，而现有的污染分析方法需要访问完整的训练数据，这常常限制了对这些模型的严格审计和准确评估。本文提出了一种新的方法来量化数据污染，通过困惑度来衡量污染程度，相关分析显示近期基础模型在流行的阅读理解和摘要化数据中存在显著的记忆化现象，而多项选择数据的污染程度较低。

Abstract

data contamination in model evaluation is getting increasingly prevalent as the massive training corpora of large language models often un

data contamination model evaluation contamination analysis training corpora perplexity

发现论文，激发创造

数据污染测试：检测和估算大型语言模型中的污染工具

我们提出了数据污染测验，一种用于检测大型语言模型（LLMs）中数据污染并估计其量的简单有效方法。我们将数据污染检测构建为一系列多项选择问题，创建了三个扰动版本的每个数据集实例。通过仅进行词级扰动，用其上下文同义词替换单词，确保其语义和句子结构与原始实例完全相同，我们设计了一个测验格式。这些扰动版本与原始实例一起构成测验中的选择项。当只有确切的措辞可以区分这些选择项时，LLM 在识别选择项中的原始实例时，如果在预训练阶段记忆了该实例，则选择原始实例，这是 LLM 固有的特性。如果 LLM 在测验中的表现超过了随机机会所示，那么数据集划分就被标记为被污染。我们的评估涵盖了七个数据集及其相应的划分（训练和测试 / 验证），在两种最先进的 LLMs：GPT-4 和 GPT-3.5 上进行。尽管无法获得预训练数据，我们的结果表明，我们的方法不仅增强了对数据污染的检测，还可以在污染信号较弱时提供准确的估计。

Nov, 2023

评估语言模型代码生成能力时的污染量量化

该研究综合研究了大型语言模型在代码生成任务中的数据污染问题，分析了常见代码生成基准测试与预训练语料之间的重叠程度，并揭示了类似训练解决方案出现时模型性能显著提高的现象，同时分析了模型大小、问题难度和问题长度等因素对模型记忆和泛化的影响。

Mar, 2024

在黑盒语言模型中证明测试集污染

通过无需预训练数据或模型权重的方法，我们可以提供对语言模型测试集污染的可证明保证，通过对典型排序的基准数据集的似然性进行比较，我们的测试能够可靠地证明测试集污染的情况。在五个常见的公开可访问的语言模型中，我们的测试发现很少有普遍污染的证据。

Oct, 2023

数据污染能够跨越语言障碍

开发大型语言模型的不透明性引起了关于潜在的训练数据污染的担忧。我们提出了一种基于跨语言的深层污染形式，可以欺骗传统的检测方法。我们还探讨了跨语言污染在解释语言模型的工作机制和提升多语言能力方面的潜在用途。

Jun, 2024

探究预训练语言模型的数据污染

本文研究了语言模型在预训练阶段遭受数据污染的影响，探索了文本污染和真实数据污染对模型性能的影响，调查了不同下游任务中污染的重复效应，并指出了当前 LLM 报告中关于污染定义的局限性和不足之处。研究结果为了解数据污染对语言模型的影响提供了新的见解，并强调在 LLM 研究中进行独立、全面的污染评估的必要性。

Jan, 2024

泛化还是记忆：大型语言模型的数据污染与可信评估

我们提出了基于 LLMs 输出分布的数据污染检测方法 CDD，并通过修正 LLMs 输出分布的方法 TED，有效地检测和减轻数据污染的影响。实验结果表明，CDD 在准确度、F1 得分和 AUC 指标方面相对其他方法平均提升了 21.8％-30.2％，TED 在 24 种设置和 21 种污染程度下成功地减轻数据污染引起的性能下降高达 66.9％。实际应用中，我们发现 ChatGPT 在 HumanEval 基准中存在受数据污染的高风险。

Feb, 2024

数据污染：从记忆到利用

本研究根据预训练语言模型在联合语料库上进行分析，发现在一些情况下存在信息的利用，但在其他情况下，模型只是纯粹地记住了数据，但并没有利用学到的知识，这两种情况受到了多重因素的影响，如污染数据的数量和模型的大小，在区分语言理解和数据利用方面，对于大规模的互联网语料库的分析具有重要意义。

Mar, 2022

重新思考以重新表述的样本为基础的语言模型基准和污染问题

大型语言模型的数据污染问题及其对应的检查与净化方法

Nov, 2023

揭示语言模型中的数据污染谱系：从检测到修复的概述

数据污染在大型语言模型 (LLMs) 时代引起了越来越多的关注，由于依赖于广泛来源于互联网的训练语料库。重叠训练语料库与评估基准的问题（称为污染）已成为重要的研究焦点。本文介绍了数据污染领域的综合调查，阐述了关键问题、方法和迄今为止的研究结果，并重点关注需要进一步研究和发展的领域。该调查对数据污染研究的最新进展进行了简明概述，为未来研究提供了清晰的指南。

Jun, 2024

现代大语言模型中数据污染问题研究

我们通过检测数据污染并提出 “Testset Slot Guessing” 方法，发现商业化的 LLM 在评估基准中有明显的性能改进，并呼吁在该领域使用更强大的评估方法和基准。

Nov, 2023