arXiv AI· Haoru Li, Jinmei Liu, Zhiyong Wang, Xiaoming Li, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang·· 14 小时前评分52
Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization
摘要
受此启发,我们引入DRIVE(多样性驱动的RL微调用于VLA泛化),将成功行为的多样性转化为显式的RL目标。DRIVE在匹配任务条件下分组 rollout,与时间对齐的轨迹进行比较,并从相对行为多样性中推导出成功条件约束的内在奖励。这种设计鼓励更广泛的可行解覆盖,而不奖励多样性的失败或表面时间差异。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org