论文11:48DemoPSD:分歧调节的策略自蒸馏这篇论文提出了DemoPSD,通过分歧调节蒸馏过程,比GRPO和SDPO在科学推理上更强,还能防止模型学到测试时无效的捷径。#DemoPSD#策略自蒸馏#推理模型#SciKnowEvalaarXiv cs.AI@Yunhe Li 等 8 人原文稍后读已读值得跟进有用关注 DemoPSD