11:43官方账号arXiv cs.AI@Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai, Dongsheng Li研究人员提出了一种基于图的在线难度估计器,用于优化强化学习可验证奖励(RLVR)的调度效率。该框架通过构建语义和推理相似性的样本图,使用Potts先验和Beta-Binomial模型聚合rollout结果。实验表明,该方法在多个基础模型、RL调度器和基准测试中实现了更好的性能,无需专门的探测即可缓解冷启动和反馈过时问题。论文RLVR强化学习图结构推荐理由:论文提出了一种即插即用的图结构难度估计器,能智能分配探索资源,让RLVR更高效。原文稍后读已读值得跟进有用关注 RLVR