09:10官方账号arXiv cs.LG@Nan Li研究团队针对2B开放权重模型在LM Playschool Challenge中的表现,发现模型失败不仅是知识不足,还有局部决策问题。他们提出三步训练方案:监督微调获取广泛游戏参与能力,使用回合局部偏好对修复特定对话游戏家族中的可验证失败,并保留对话游戏外的通用能力。该方法将公开clemscore从10.67提升至38.92,领域内分数从13.41提升至41.17,同时保持静态性能基本不变。论文LM Playschool Challenge2B模型对话游戏代理推荐理由:研究人员为小模型对话游戏代理设计了一套三步训练法,显著提升了特定任务表现,同时保持通用能力。原文稍后读已读值得跟进有用关注 LM Playschool Challenge