跳到正文
arXiv AI· Haoru Li, Jinmei Liu, Zhiyong Wang, Xiaoming Li, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang·· 14 小时前评分52

Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization

摘要

受此启发,我们引入DRIVE(多样性驱动的RL微调用于VLA泛化),将成功行为的多样性转化为显式的RL目标。DRIVE在匹配任务条件下分组 rollout,与时间对齐的轨迹进行比较,并从相对行为多样性中推导出成功条件约束的内在奖励。这种设计鼓励更广泛的可行解覆盖,而不奖励多样性的失败或表面时间差异。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org