跳到正文
arXiv AI· Zhiwei Wang, Yanxi Chen, Yaliang Li, Bolin Ding·· 7 天前评分58

Fine-Tuning on Self-Generated and Reward-Weighted Data: Learning Dynamics, Convergence Rates, and Benefits of Off-Policyness

摘要

我们研究在自动生成和奖励加权数据上微调策略模型的学习动力学,特别关注一种广义的REINFORCE——称为RE(S)——它每$S geq 1$梯度步更新一次 rollout 分布。在带宽和强化学习领域,先前的工作已发展出丰富的理论支持政策梯度方法,且在线采样(即小$S$,理想情况下为$1$)通常被视为其成功的关键因素;然而,在如脱训练大语言模型等重要应用中,即使 rollout 分布更新频率较低,奖励引导的自训练仍表现出有效性,但这些离线方法的收敛性质仍缺乏理论理解。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org