论文12:20ExpRL:利用探索性强化学习进行LLM中间训练这篇论文用参考答案做奖励支架,让模型自己探索推理路径,数学推理效果超过了SFT和GRPO,想提升推理能力的可以看看。#ExpRL#LLM#强化学习#推理模型aarXiv cs.LG@Violet Xiang 等 5 人原文稍后读已读值得跟进有用关注 ExpRL