跳到正文
Apple Machine Learning Research·· 1 天前精选评分83

RISED: Rubrics for Agentic Multi-Environment Selection and Self-Distillation

摘要

单个LLM代理在多样化的交互环境中联合训练已引起广泛关注,作为通用智能体的路径。现有课程和数据选择策略通常在环境层面分配训练或优先考虑本地奖励信号,而未明确考虑不同环境间当前 rollout 的关系,用于提示组选择。同时,由于环境学习速率不同,所有失败和所有成功 rollout 组可在一批中共存,导致数据无组相对奖励信号。

推荐理由

请对照Apple Machine Learning Research原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:Apple Machine Learning Research · machinelearning.apple.com