论文13:24DASH:面向推理模型on-policy自蒸馏的自适应监督视野这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。#DASH#OPSD#RLVR#数学推理aarXiv cs.AI@ZhiYan Hou 等 12 人原文稍后读已读值得跟进有用关注 DASH