论文11:28强化学习用于代码优化:三阶段方法提升执行速度奖励信号一篇教你用强化学习优化代码执行速度的论文,针对测量噪声和奖励稀疏问题设计了DMC-Optim基准和三阶段方法,让Qwen 2.5 7B的pass@1从18%提到31%,CWM 32B提到50%。#DMC-Optim#GRPO#代码优化#强化学习aarXiv cs.LG@Pierre Chambon 等 5 人原文稍后读已读值得跟进有用关注 DMC-Optim