19:25官方账号arXiv cs.LG@Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang精选73°研究显示进化策略(ES)在LLM推理训练中表现优于GRPO方法。ES在Pass@1基准上提升性能,同时获得比GRPO更高的Pass@K分数。ES仅需更大模型中的较小种群规模即可有效工作。研究还发现ES的功能稀疏性表明大量参数移动不一定导致广泛功能变化。论文LLM进化策略GRPO推荐理由:这篇论文对比了ES和GRPO两种训练方法,发现ES能带来更广泛的推理覆盖,还提出了结合两者优势的GRPO-ES顺序训练策略。原文稍后读已读值得跟进有用关注 LLM