利用隐含背景完成 Pareto 最优偏好学习

Jun, 2024

利用隐含背景完成 Pareto 最优偏好学习

Pareto-Optimal Learning from Preferences with Hidden Context

Ryan Boldi, Li Ding, Lee Spector, Scott Niekum

TL;DR通过使用 Pareto Optimal Preference Learning (POPL) 模型，借助于 Lexicase 筛选过程，本研究实证评估表明 POPL 在学习奖励函数方面超过基线方法，有效满足不同的群体需求，并确保包容和公平的人工智能模型对齐。

Abstract

Ensuring ai models align with human values is essential for their safety and functionality. reinforcement learning from human feedback (RL

ai models reinforcement learning human feedback pareto optimal preference learning group fairness

发现论文，激发创造

理解从人类偏好中学习的一般理论范式

通过对人类偏好进行学习的强化学习（RLHF）部署依赖于两个重要的近似：第一个假设可以用点奖励替代成对偏好；第二个假设在这些点奖励上训练的奖励模型可以从策略采样的超出分布数据中进行泛化。最近，直接偏好优化（DPO）被提出作为一种绕过第二个近似并直接从收集到的数据中学习策略的方法。然而，该方法仍然严重依赖于第一个近似。本文尝试对这些实际算法进行更深入的理论理解。特别是，我们推导出一种新的称为 ΨPO 的通用目标，用成对偏好表示，从而绕过了两个近似。这个新的通用目标使我们能够对 RLHF 和 DPO 的行为进行深入分析（作为 ΨPO 的特殊情况），并确定它们的潜在缺陷。然后，我们通过将 Ψ 简单地设置为 Identity 来考虑 ΨPO 的另一种特殊情况，在此情况下，我们可以推导出一个有效的优化过程，证明其性能保证，并在一些示例中展示其在实证上优于 DPO。

Oct, 2023

强化学习与人类反馈的自适应偏好缩放

提出了一种新的自适应偏好损失函数，基于分布均衡优化，用于解决偏好强度不确定性问题，通过引入自适应缩放参数增加了对奖励函数的灵活性。实验证明，该方法不仅提升了策略性能，还使奖励函数的选择更加贴合策略优化，简化了超参数调整过程。

Jun, 2024

分布式偏好学习：理解并考虑 RLHF 中的隐藏语境

通过分析人类的反馈学习中的偏好数据，我们发现隐藏背景信息可能导致一些反直觉的结果，从而引发强化学习算法的漏洞。为了减轻这些问题，我们引入了一种称为分布式偏好学习的方法，能够更好地考虑隐藏背景，并显著降低后续遭受攻击的概率。

Dec, 2023

通过个性化和偏好聚合来自异构反馈的基于原则的 RLHF

利用个性化和聚合两个框架解决存在异质人类反馈的增强学习中的问题并确保较高的样本效率。

Apr, 2024

对比偏好学习：无需 RL 的人类反馈学习

使用最大熵原理，引入了一种从人类反馈中优化行为的新型算法 Contrastive Preference Learning (CPL)，该算法能够在不学习奖励函数的情况下，通过偏好学习最优策略，克服了优化挑战并能应用于任意 MDPs 环境。

Oct, 2023

使用未观测到的偏好异质性进行直接偏好优化

利用 DPO 和最大期望适应机制，通过生成模型的混合来对齐不同人类偏好的生成模型，同时引入极小极大后悔集成学习模型以在类似潜在因素的注释者子组之间最小化最坏情况后悔，实验证实了方法在产生公正生成策略方面的有效性。

May, 2024

大型语言模型的主动偏好学习

利用 DPO 进行喂养，通过预测语言模型的预测熵和由 DPO 优化的隐式优先级模型的确定性度量，我们开发了一种主动学习策略来更好地利用偏好标签，从而提高配对偏好数据的学习速率和最终性能。

Feb, 2024

基于密度估计的从两两人类偏好中学习的视角

借助人类反馈（LHF）特别是借助成对偏好学习，最近成为训练大型语言模型（LLM）的重要组成部分并且引起了广泛研究。本文提出了一个替代解释，将其视为成对偏好的生成过程，并将 LHF 视为密度估计问题，通过实践和理论结果证明了基于成对偏好训练奖励函数能够有效地模拟标注者的隐含偏好分布。最后，我们讨论并呈现了有关 “标注者错误建模” 的发现。这些错误建模假设标注者行为出现错误，导致不适应的模型，在多样性观点的标注者群体中，借助成对人类偏好进行学习可能存在困难。

Nov, 2023

偏好作为奖励，通过重要性采样进行最大偏好优化

这篇论文介绍了一种重要的技术 —— 偏好学习，其中 Reinforcement Learning from Human Feedback（RLHF）是一种优化偏好学习的模型算法，通过对偏好得分建立奖励模型并优化生成策略；为了提高数据效率和稳定性，提出了使用离策略算法进行直接优化生成策略的 Direct Preference Optimization（DPO）算法；通过增加离策略 KL 正则化项实现了 KL 正则化的真正有效性。

Dec, 2023

混合偏好优化：通过数据选择和更好的参考模型进行强化学习

本文研究了大规模语言模型（LLMs）对齐的两种主要方法：强化学习与人类反馈（RLHF）以及基于对比学习的直接偏好优化（DPO）。通过分析 RLHF 和 DPO 的稳定性和鲁棒性，我们提出了一种新方法 MPO（混合偏好优化），该方法减轻了两种方法的缺点。我们提出了一个两阶段的训练过程：首先在一个简单的数据集上对 DPO 进行训练，然后在一个具有 DPO 模型作为参考模型的困难集上进行 RLHF。实验在两个公开的对齐数据集上进行，即 HH-RLHF 和 TLDR，展示了 MPO 的有效性，无论是在 GPT4 上还是人类评估上。

Mar, 2024