事件专题 · 单一信源

大语言模型自动评分Linux/bash考试:四级认知分类方法

该研究评估了GPT、Claude Opus、Gemini和GLM四个大语言模型在短Linux/bash命令回答评分中的表现。采用四级认知分类(L1信息检索至L4高级系统管理),在1200个真实学生回答上与三位专家评分对比。Gemini 3.0 Pro配合rubric引导提示达到最高一致性(ICC(3,1)=0.888,MAE=0.10)。一致性随认知层级上升而下降,提示质量比模型选择影响更大。该框架可确定哪些问题适合AI辅助评分。

当前结论

想用AI批改Linux命令作业?试试Gemini 3.0 Pro加评分rubric,人机一致性高达0.888。

2 个信源38° AI 热度最后更新 2026/7/2 17:01:47

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情