09:30官方一手arXiv: DeepSeek@Siyuan Gan, Yuhan Li, Xiran Wang, Linjian Meng, Boyan Wang, Zhen Zhao, Jing Huo, Yang Gao精选73°研究人员提出RA-OPD方法解决教师模型误导问题。该方法在Qwen3和DeepSeek-R1模型家族上测试。RA-OPD过滤掉与结果奖励不一致的轨迹。在七个数学基准和三个代码基准上表现优于标准OPD。论文RA-OPDQwen3DeepSeek-R1推荐理由:论文提出RA-OPD解决教师模型误导问题,在数学和代码基准上显著提升性能。原文稍后读已读值得跟进有用关注 RA-OPD