09:53官方账号arXiv cs.LG@Jian Zhang, Bingyi Wang, Yizhi LiuCausalOPD是一种课程式在线过程蒸馏框架,让教师模型先基于因果规则生成轨迹,再由学生模型在线生成并定位首个违反约束的错误步骤。框架通过短视距强化学习修复局部错误,并按证据级、机制级、结论级的因果阶段推进训练。在临床诊断、法律判断和工业故障诊断三个领域,CausalOPD将路径正确率平均提升23.4个百分点,并将“答案对但推理错”的比例从15.7%降至4.4%。基于该方法的8B学生模型在路径正确率上超过两个商业参考模型。论文CausalOPD因果链推理知识蒸馏推荐理由:这是篇讲怎么把大模型因果推理能力蒸馏到小模型的新论文,CausalOPD专治“答案对但推理过程错”,三个领域里错误率从15.7%砍到4.4%,小模型还赢过了大牌模型。原文稍后读已读值得跟进有用关注 CausalOPD