研究评估预训练模型对 AI 生成教育题目的布鲁姆分类效果
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
想做 AI 出题自动质检的可以看看:论文实测了 LLM、BERT、传统 ML 在布鲁姆分类上的 OOD 表现,LLM 拿到 0.79 的 F1,还给了几个低成本补救手段。
论文搞了个8B的小模型FATE,专门给AI老师打分,比蒸馏前涨了22个点。还顺便测了Gemini、ChatGPT等,Gemini 2.5 Flash得分最高,挺有意思。
想用AI推理过程预测题目难度?这篇论文提出了Epi2Diff,从LRM的思考轨迹中提取片段特征,比直接微调模型效果好8%以上,而且可解释。
伯克利分析了50万份成绩,发现ChatGPT让学生的作业分数上涨,但考试没变化——说明AI在帮学生代写作业,而不是帮他们学东西。
李飞飞直指 AI 时代教育的核心矛盾——标准化考试已失效,做教育决策、课程设计或关心孩子未来的家长/老师,值得听听这位 AI 领袖的变革思路。