arXiv AI· Octi Zhang, Mateo Guaman Castro, Patrick Yin, Ignacio Dagnino, Abhishek Gupta, Rosario Scalise, Byron Boots·· 10 小时前评分53
A Balanced Data Diet: Addressing the Exploration Bottleneck in Mega-Scale RL for Robot Control
摘要
为缓解此问题,我们引入了成功引导采样(SGS),一种简单的自适应采样器,将强化学习训练集中在政策能力前沿的任务配置上。这样做使大规模模拟强化学习能够充分利用经验,实现大规模并行模拟的高效扩展。在使用至 $2^{20}(超过一百万)并行环境的实验中,SGS使强化学习能够解决此前方法无法解决的复杂地形四足运动和接触丰富的装配任务。
推荐理由
请对照arXiv AI原文,核对完整说明及适用条件。
本站只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv AI · arxiv.org