arXiv AI· Saif Punjwani, Micah Goldblum·· 10 小时前评分30
Decoupling Exploration from Optimization in RLVR
摘要
现代语言模型在已训练检查点上进行可验证奖励的强化学习(RLVR),其关键承诺是发现新的推理策略。理论上,模型可以采样出与先前训练数据无关的新想法。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org