论文70°19:11EXPO:自适应KL调节与高斯课程采样的探索优先策略优化该工作针对GRPO在LLM数学推理中的实际瓶颈提出两项轻量改进,AKL与GCS模块即插即用,实验验证显著提升pass@32指标,对强化学习训练策略的优化具有直接指导意义。#GRPO/强化学习#数学推理#自适应KL调节#高斯课程采样aarXiv: DeepSeek@Mingxiong Lin 等 9 人原文稍后读已读值得跟进有用关注 GRPO/强化学习