主要来源arXiv cs.AI
查看原文事件专题 · 单一信源
大语言模型自动评分Linux/bash考试:四级认知分类方法
该研究评估了GPT、Claude Opus、Gemini和GLM四个大语言模型在短Linux/bash命令回答评分中的表现。采用四级认知分类(L1信息检索至L4高级系统管理),在1200个真实学生回答上与三位专家评分对比。Gemini 3.0 Pro配合rubric引导提示达到最高一致性(ICC(3,1)=0.888,MAE=0.10)。一致性随认知层级上升而下降,提示质量比模型选择影响更大。该框架可确定哪些问题适合AI辅助评分。
当前结论
想用AI批改Linux命令作业?试试Gemini 3.0 Pro加评分rubric,人机一致性高达0.888。
2 个信源38° AI 热度最后更新 2026/7/2 17:01:47
证据链
相关来源 1小互
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。