跳到正文
arXiv AI· Benhao Huang, Chufan Shi, Junlin Chen, Shicheng Wen, Zhengzhong Liu, Eric Xing, Xuezhe Ma·· 19 小时前评分35

Towards Looped Models Done Right, Part II: Rethinking at Fixed Points

摘要

每个循环语言模型的递归都会增加训练、解码、预填充和强化学习(RL)的成本。当递归状态越接近固定点,路径的重要性就越小。这使得训练中可以使用截断反向传播;在解码时实现几乎无损的终端键值(KV)共享;学生模型可提前预填充至1.79倍速度;以及RL更新能从保存的轨迹状态中计算梯度,速度是反向传播的2倍。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org