高效 RLHF：降低 PPO 的内存使用

Sep, 2023

Efficient RLHF: Reducing the Memory Usage of PPO

Michael Santacroce, Yadong Lu, Han Yu, Yuanzhi Li, Yelong Shen

TL;DRReinforcement Learning with Human Feedback (RLHF) revolutionized language modeling by aligning models with human preferences. This paper presents the memory usage, performance, and training time analysis of memory-savings techniques for Proximal Policy Optimization (PPO). The proposed Hydra-RLHF integrates Supervised Fine-Tuning (SFT) and Reward models and dynamically turns LoRA 'off' during training, reducing memory usage and improving alignment across benchmarks. Resulting in a simple and promising solution, Hydra-PPO enables more widespread usage of RLHF.

Abstract

reinforcement learning with human feedback (rlhf) has revolutionized language modeling by aligning models with human preferences. However, the RL stage, Proximal Policy Optimization (PPO), requires over 3x the me

reinforcement learning with human feedback rlhf memory-savings techniques hydra-rlhf widespread usage of rlhf

发现论文，激发创造

大型语言模型中 RLHF 的秘密第一部分: PPO

大型语言模型对人工通用智能发展提出了一个使命，与人类对齐是其最重要的挑战，强化学习与人类反馈是支撑此追求的关键技术，并探讨了在 PPO 算法中影响策略代理训练的部件，并提出了 PPO-max 增强版本以提高策略模型的训练稳定性，总结了与 SFT 模型和 ChatGPT 相比的 RLHF 能力的全面分析。

Jul, 2023

RRHF：无需痛苦排名回应，将语言模型与人类反馈对齐

RRHF 是一种新的学习范式，通过排名损失函数对生成的回答进行评分，从而能够有效地将语言模型输出与人类偏好对齐，而且只需要 1 到 2 个模型进行调整，效果与微调相当。

Apr, 2023

SuperHF：基于人类反馈的监督式迭代学习

基于大型语言模型对齐的一种新方法 SuperHF，旨在解决安全性、人类价值的对齐以及训练稳定性方面的挑战。SuperHF 结合了 Supervised Fine-Tuning 和 Reinforcement Learning from Human Feedback 的优点，并通过替换 PPO 算法和引入 KL divergence 先验，提出了一种新的训练方法。实验结果表明，SuperHF 在训练目标、奖励优化和模型性能等方面表现优于基于 PPO 的 RLHF，具有竞争力的语言模型对齐技术。

Oct, 2023

回归基础：重新评估 LLMs 中学习人类反馈的 REINFORCE 样式优化

通过改进 Proximal Policy Optimization，使用 REINFORCE-style optimization 的方法在低成本情况下实现在线强化学习优化，从而提高 AI 对人类反馈的 RLHF 的性能。

Feb, 2024

使用强化学习训练大型语言模型进行推理

从人类反馈中进行强化学习（RLHF）已成为将 LLM 输出与人类偏好对齐的一种主要方法。受 RLHF 成功的启发，我们研究了从反馈中学习（Expert Iteration，Proximal Policy Optimization（PPO），Return-Conditioned RL）对改善 LLM 推理能力的多种算法的性能。我们通过启发式和学习的奖励模型为 LLM 提供了稀疏和密集奖励。我们还从多种模型尺寸和初始化状态，包括有和没有经过监督微调（SFT）数据的情况开始研究。总的来说，我们发现所有算法的性能相当，大多数情况下 Expert Iteration 的性能最佳。令人惊讶的是，我们发现 Expert Iteration 的样本复杂度与 PPO 相似，需要最多约 $10^6$ 个样本从预训练检查点收敛。我们研究了为什么会这样，并得出结论，在 RL 训练期间，模型未能在 SFT 模型已经产生的解之外进行显着的探索。此外，我们讨论了 SFT 训练期间 maj@1 和 pass@96 度量性能之间的取舍，并且相反，RL 训练同时改善了两者。最后，我们讨论了我们的发现对 RLHF 和 LLM 微调中 RL 的未来角色的影响。

Mar, 2024

探索低秩调整对 RLHF 的性能、效率和正则化的影响

通过使用低秩调整方法对 RLHF 进行改进，本研究使用仅两个 A100 GPU 就能够将 LLaMA 7B 检查点与 Alpaca 数据集对齐，并在仅调整了 0.2% 参数的情况下，比全模型微调的公开发布的 AlpacaFarm 检查点取得更好的性能。同时，我们发现 Jensen-Shannon 距离作为正则化项的效果更好，并且通过使用 LoRA 进行训练能够在一定程度上减少 PPO 训练对模型生成回答的准确性的负面影响。

Sep, 2023

使用离线强化学习与人类反馈对齐语言模型

通过离线强化学习从人类反馈中对齐语言模型，采用最大似然估计、加权回归奖励和决策变换方法，实现了比在线 RL 方法更稳定的模型训练和更高的性能。

Aug, 2023

近端策略优化实战：操纵输出标记长度

通过使用奖励模型和 Proximal Policy Optimization（PPO）来操控模型生成的输出 tokenizer 长度的新任务，实验证实 PPO 在操控输出 tokenizer 长度以及训练效果方面的有效性和发展潜力。

Aug, 2023

基于 PPO 的 RLHF 的 N + 实现细节：TL;DR 摘要的案例研究

本研究首次公开复现了 OpenAI 的研究成果中提到的强化学习从人类反馈中进行总结的可扩展行为。我们从头开始创建了一个强化学习从人类反馈的流水线，列举了 20 多个关键的实施细节，并在复现过程中分享了关键见解。我们训练的 Pythia 模型在响应质量上取得了显著的进展，其规模与模型的大小成比例，2.8B 和 6.9B 的模型表现优于 OpenAI 发布的 1.3B 检查点。我们公开发布了训练好的模型检查点和代码以促进进一步的研究并加快该领域的进展。

Mar, 2024

成对近邻策略优化：利用相对反馈进行 LLM 对齐

通过相对反馈，本文介绍了一种更简单而有效的方法，以相对反馈将大型语言模型对齐到人类的偏好。

Sep, 2023