arXiv AI· Yijia Fan, Ziqi Huang, Zhongang Cai, Yan Li, Zimo Wen, Wanqi Yin, Haiwen Diao, Ziwei Liu·· 8 天前评分58
Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
摘要
我们引入UMM-反射,将其应用于统一模型内完成反射轨迹:兄弟轨迹共享初始图像,因此群体相对优势比较反射策略,轨迹级优势更新反射令牌和基于流的修订,避免每轮信用分配的组合爆炸。与单轮编辑或外部判别器的管道不同,信用在轮次间流动,并传递至同一模型的两个角色,无需推理验证。在BAGEL上,UMM-反射在SFT基础上提升GenEval 12.05 分,优势转移至WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63),其中未用于训练。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org