论文Agent 与开发者10:11Sherpa:用多轮强化学习让 LLM 学会因材施教用 LLM 扮演不同类型的学生,让教师模型通过强化学习直接优化学生成绩,教学得分从 52.5% 拉到 79.2%,做 AI 教育的可以看看。#Sherpa#MathTutorBench#强化学习#AI教育aarXiv cs.AI@Weixian Xu 等 5 人原文稍后读已读值得跟进有用关注 Sherpa