May, 2024
大规模语言模型对线机恁学习的离维匀整进化
Offline Regularised Reinforcement Learning for Large Language Models Alignment
Pierre Harvey Richemond, Yunhao Tang, Daniel Guo, Daniele Calandriello, Mohammad Gheshlaghi Azar...
TL;DR通过使用单轨迹数据集,本研究提出了 DRO(Direct Reward Optimization)框架和相关算法,无需配对偏好数据,采用简单的均方误差目标函数实现。使用 T5 编码器 - 解码器语言模型进行实证验证,证实了 DRO 相对于 KTO 等基准模型在单轨迹策略优化方面的性能优势。