跳到正文
arXiv AI· Saif Punjwani, Micah Goldblum·· 10 小时前评分30

Decoupling Exploration from Optimization in RLVR

摘要

现代语言模型在已训练检查点上进行可验证奖励的强化学习(RLVR),其关键承诺是发现新的推理策略。理论上,模型可以采样出与先前训练数据无关的新想法。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org