8月31日
09:30
09:30官方一手arXiv: DeepSeek@Siyuan Gan, Yuhan Li, Xiran Wang, Linjian Meng, Boyan Wang, Zhen Zhao, Jing Huo, Yang Gao
精选73°
研究人员提出RA-OPD方法解决教师模型误导问题。该方法在Qwen3和DeepSeek-R1模型家族上测试。RA-OPD过滤掉与结果奖励不一致的轨迹。在七个数学基准和三个代码基准上表现优于标准OPD。
推荐理由:论文提出RA-OPD解决教师模型误导问题,在数学和代码基准上显著提升性能。