May, 2024

大规模语言模型对线机恁学习的离维匀整进化

TL;DR通过使用单轨迹数据集,本研究提出了 DRO(Direct Reward Optimization)框架和相关算法,无需配对偏好数据,采用简单的均方误差目标函数实现。使用 T5 编码器 - 解码器语言模型进行实证验证,证实了 DRO 相对于 KTO 等基准模型在单轨迹策略优化方面的性能优势。