11:28官方账号arXiv cs.LG@Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve论文提出DMC-Optim基准,用于评估代码优化RL。通过三阶段方法解决测量噪声和奖励稀疏问题:构建校准沙箱测试,组合正确性与速度奖励,并适配GRPO到稀疏场景。在DMC-Optim上,Qwen 2.5 7B的top-50% pass@1从18.0%提升至31.3%,CWM 32B从30.7%提升至50.4%。top-30%时CWM 32B相对提升125%,且保持纯正确性分数不变。在LCB上,CWM 32B赢得83%的中位数样本速度对比。论文DMC-OptimGRPO代码优化推荐理由:一篇教你用强化学习优化代码执行速度的论文,针对测量噪声和奖励稀疏问题设计了DMC-Optim基准和三阶段方法,让Qwen 2.5 7B的pass@1从18%提到31%,CWM 32B提到50%。原文稍后读已读值得跟进有用关注 DMC-Optim