跳到正文
arXiv AI Education· Weixian Xu, Yanzhe Zhang, Zora Zhiruo Wang, Changyu Chen, Diyi Yang·· 9 小时前评分63

Sherpa: Teaching LLMs to Teach Adaptively

摘要

为了解决这个问题,我们引入了Sherpa,一个多轮强化学习框架,通过条件约束不同学习偏好下的LLMs实例化多个学生角色,并训练教师模型直接最大化其学习成果。使用Sherpa训练的教师LLMs在所有角色中使指导学生表现提升平均20.5个百分点。在MathTutorBench评估中,Sherpa将整体教学评分从52.5%提升至79.2%,表明教学响应更优。

推荐理由

请对照arXiv AI Education原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI Education · arxiv.org