Bileve：使用双层签名保护大型语言模型中的文本来源免受欺诈

Jun, 2024

Bileve：使用双层签名保护大型语言模型中的文本来源免受欺诈

Bileve: Securing Text Provenance in Large Language Models Against Spoofing with Bi-level Signature

Tong Zhou, Xuandong Zhao, Xiaolin Xu, Shaolei Ren

TL;DR通过引入一种双层签名方案（Bileve），本研究在大型语言模型中使用文本水印以提高源头追踪能力，并对抗欺骗攻击。实验证明 Bileve 在增强检测能力方面表现出色，有效地防止了欺骗攻击。

Abstract

text watermarks for large language models (LLMs) have been commonly used to identify the origins of machine-generated content, which is promising for assessing liability when combating deepfake or harmful content

text watermarks large language models bi-level signature scheme spoofing attacks detectability

发现论文，激发创造

大语言模型时代的文本水印调查

通过文本水印技术，在生成的文本中嵌入不可见但可检测的模式，有助于追踪和验证文本来源，从而防止滥用和盗版。该综述对当前的文本水印技术进行了全面总结，包括不同技术的概述和比较、算法的评估方法以及可能的应用领域，以帮助研究人员全面了解文本水印技术、促进进一步的发展。

Dec, 2023

大型语言模型的增强可检测性和语义一致性的特定记号水印

利用多目标优化方法实现识别性与语义完整性，我们提出了一种在大型语言模型生成的文本中嵌入水印的新方法。实验证明，我们的方法在提高大型语言模型生成文本的可识别性的同时保持其语义连贯性方面优于当前的水印技术。

Feb, 2024

关于大型语言模型中水印可靠性的研究

本文探讨使用不同的检测方法来对水印进行可靠的鉴别，并研究机器生成文本的大量观察对于水印的鉴别是否可靠，最终表明水印技术是一项可靠的解决方案，尤其是在样本复杂度越高时，水印证据会逐渐累积，并最终被检测出来。

Jun, 2023

巩固大型语言模型的三个水印砖块

该研究以三个理论和实证考虑为基础，为大型语言模型提出了水印的方法，其中包括新的统计测试、经典基准的效果比较以及高级侦测方案的开发。

Jul, 2023

超越识别：多位比特语言模型水印技术

本研究以主动应对大型语言模型的滥用问题为目标，针对一些恶意滥用需要追踪对手用户的情况，提出了 “多位比特水印技术基于颜色排序”（COLOR）方法，在语言模型生成过程中嵌入可追踪的多位比特信息。COLOR 利用了零位水印技术的优势，实现了无需模型访问的提取，即时嵌入，并保持了文本质量，同时还可以进行零位检测。初步实验展示了在中等长度（约 500 个标记）的文本中成功嵌入 32 位信息，准确率为 91.9%。本研究推进了对抗语言模型滥用的有效策略。

Aug, 2023

可学习的语言水印：对大型语言模型的模型提取攻击进行追踪

在快速发展的人工智能领域中，保护大型语言模型（LLMs）的知识产权变得越来越关键。我们提出了一种新颖的方法，在 LLMs 中嵌入可学习的语言水印，以追踪和防止模型提取攻击。我们的方法通过向令牌频率分布中引入可控噪声来微妙地修改 LLM 的输出分布，嵌入可统计辨识的可控水印。我们利用统计假设检验和信息理论，特别关注库尔巴克 - 莱布勒散度，有效区分原始分布和修改分布。我们的水印方法在鲁棒性和输出质量之间达到了微妙的平衡，保持了较低的误报率和漏报率，并且保留了 LLM 的原始性能。

Apr, 2024

大型语言模型的自适应文本水印

该论文提出了一种自适应水印策略来解决大语言模型生成高质量水印文本并保持强大安全性、稳健性以及在没有先验知识的情况下检测水印的能力的问题。

Jan, 2024

DeepTextMark：基于深度学习的文本水印技术，应用于检测大规模语言模型生成的文本

本研究提出了 DeepTextMark，是一个基于深度学习技术的文本水印方法，能够实现对文本来源的高质量检测，具有盲性、鲁棒性、隐蔽性和可靠性，是一种用于文本生成系统的附加系统。

May, 2023

大型语言模型中的水印窃取

LLM 水印技术的研究表明当前方案的可部署性存在争议，因为我们发现了基于这些方案的水印窃取攻击和刷水攻击的重大漏洞。我们提出了一种自动化的水印窃取算法，并在实际环境中对伪造和刷水进行全面研究，揭示出以前被忽视的攻击能力和成功率。这些发现对 LLM 水印技术的普遍认知提出了挑战，强调了更强大方案的需求。

Feb, 2024

标记我的言辞：分析和评估语言模型水印

在大型语言模型的能力与对其滥用的担忧日益增长的背景下，对机器生成的文本与人类作者的内容进行区分的能力变得重要。本研究侧重于文本水印技术而非图像水印，并提出了一个全面的评估框架，包括不同任务及实际攻击的水印技术基准。我们关注三个主要指标：质量、大小（例如，检测水印所需的标记数）和防篡改性。目前的水印技术已足够用于部署，但我们认为水印的不可辨认性要求过高；略微修改逻辑分布的方案在生成质量上胜过不可辨认的对应方案且无明显质量损失。我们公开发布我们的基准测试。

Dec, 2023