11:43官方账号arXiv cs.AI@Jhen-Ke Lin研究表明,小语言模型在明确评分标准下批改开放式考试答案的可靠性与昂贵模型相当。研究测试了来自两个模型家族的六种成本高效模型配置,每个配置回答24个问题并对每份答案评分三次,共产生3456个评分。答案身份解释了95.6%的评分差异,而评分者身份仅解释0.2%的差异。评分标准将评分与评分者智能解耦,在评分标准中,官方答案几乎承担了所有工作。论文rubriclanguage modelsgrading推荐理由:研究发现小模型按评分标准批改试卷和大模型一样可靠,评分标准比模型智能更重要。原文稍后读已读值得跟进有用关注 rubric