11:43官方账号arXiv cs.AI@Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai, Dongsheng Li研究人员提出了一种基于图的在线难度估计器,用于优化强化学习可验证奖励(RLVR)的调度效率。该框架通过构建语义和推理相似性的样本图,使用Potts先验和Beta-Binomial模型聚合rollout结果。实验表明,该方法在多个基础模型、RL调度器和基准测试中实现了更好的性能,无需专门的探测即可缓解冷启动和反馈过时问题。论文RLVR强化学习图结构推荐理由:论文提出了一种即插即用的图结构难度估计器,能智能分配探索资源,让RLVR更高效。原文稍后读已读值得跟进有用关注 RLVR
19:59官方一手Sebastian Raschka: Ahead of AI@Sebastian Raschka, PhD这篇教程演示了如何从零构建AI文本检测器。项目流程包括数据集构建、模型训练、本地部署和RLVR。教程以实际项目为载体,适合想学习RLVR应用的人。技巧AI文本检测器RLVR数据集构建推荐理由:从零搭AI文本检测器的完整教程,含数据集、训练、部署和RLVR,适合想亲手走一遍流程的朋友。原文稍后读已读值得跟进有用关注 AI文本检测器
13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。论文DASHOPSDRLVR推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。原文稍后读已读值得跟进有用关注 DASH
20:11Thomas Wolf@Thom_Wolf精选Thom_Wolf 在 X 上指出,宪法训练(constitutional training)与可验证奖励强化学习(RLVR)不该在数据流形上分家。模型却擅长把细粒度区别编码进独立的表示空间。这种分离可能让两种训练目标互相干扰。AI模型RLVR宪法训练AI安全推荐理由:一个训练上的坑:模型会把宪法训练和 RLVR 隔到不同表示空间,Thom_Wolf 说这样不行。原文稍后读已读值得跟进有用关注 RLVR
04:32向阳乔木@vista8GPT-3时代只有token预测,ChatGPT通过InstructGPT引入RLHF才学会对话。RLHF基于人类偏好打分,让模型更讨喜但付出了降低学术能力的对齐税。2024年Claude Sonnet 3.5采用RLVR训练编码智能体,以测试用例作为可验证奖励。模型在虚拟环境中反复试错并复制成功路径,导致输出更机械、冗长、说行话。行业RLHFRLVRClaude推荐理由:Kun Chen解释了为什么新模型越来越像机器人:训练从讨好人类变成了刷测试用例,看完你就明白根源在哪。原文稍后读已读值得跟进有用关注 RLHF
00:17AK@_akhaliq这篇论文提出从RLVR到RLSVR的转换方法,用任务变换为开放式LLM生成自验证奖励,从而支持无需外部反馈的自我改进。RLVR原本依赖可验证答案,RLSVR将其扩展至开放式任务,让模型自己产生验证信号。论文已上线Hugging Face,由akhaliq转发推荐。论文RLVRRLSVR自我改进推荐理由:开放式任务也能用强化学习自我改进了,这篇论文把RLVR升级成RLSVR,不用人工奖励,AI自己验证自己。原文稍后读已读值得跟进有用关注 RLVR
09:33orange.ai@oran_ge76°最近半年,AI模型在agentic coding方面通过RLVR训练取得显著进步,但在其他领域如英文写作上出现倒退。Opus从4.7到5被认为完全是失败的试验品,Mythos和Fable也仅在刚发布时表现最佳。评论者指出,AI公司聚焦编码领域RL训练,导致模型通用性下降,语言输出能力甚至不如o3。早期LLM的通用性来自语料库训练,但RL专注单一领域使其他能力退化。行业agentic codingRLVROpus推荐理由:有人发现AI写代码越来越强但说话越来越难懂,连Opus都退步了,这个分析直击当前模型训练的短板。原文稍后读已读值得跟进有用关注 agentic coding
12:09官方账号arXiv cs.LG@Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" WangISO是一种专门为可验证奖励强化学习(RLVR)设计的优化框架。它通过保持基模型的权重谱不变,仅优化输入输出奇异帧来实现模型适配。离线版本ISO-Merger无需数据或梯度就能合并多个专家模型,在无数据合并方法中性能最强。在线版本ISO-Optimizer在Qwen3-8B-Base上,仅用100步就达到AdamW需270步的准确率(0.495),210步后进一步提升至0.509。实验覆盖1.5B到8B参数的推理与代码任务。AI模型ISORLVRQwen3推荐理由:如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。原文稍后读已读值得跟进有用关注 ISO
12:06官方账号arXiv cs.LG@Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi标准RLVR在模型无法生成任何正确答案时会得到零学习信号,导致困难问题无法收敛。Off-Context GRPO通过在训练中引入解法前缀作为特权引导,使模型获得非零奖励。该方法通过重要性校正目标避免引导与原始目标的偏差,在标准数学推理基准上比vanilla GRPO平均绝对提升3.9%(相对提升13.8%),且额外成本可忽略。论文Off-Context GRPOGRPORLVR推荐理由:模型一遇到难题就原地踏步?这篇论文给出了一个简单又有效的解法:给模型一点'提示',效果直接涨3.9%,成本几乎为零。原文稍后读已读值得跟进有用关注 Off-Context GRPO
11:33官方账号arXiv cs.LG@Michael Jungo, Aixiu An该研究探讨了基于可验证奖励的强化学习(RLVR)在神经机器翻译(NMT)后训练中的应用。实验发现,在推理阶段保留模型的推理痕迹能显著提升翻译质量,尤其在法律文档翻译中表现突出。但推理过程导致输出token数量增加约30%,需在计算成本与翻译质量间权衡。研究通过系统性地从训练或推理阶段移除推理轨迹,明确了推理痕迹对质量的贡献主要来自推理阶段而非训练阶段。论文RLVR神经机器翻译强化学习推荐理由:这篇论文用实验告诉你:机器翻译加推理步骤质量更好,但token成本涨三成,做生产部署前得算清楚这笔账。原文稍后读已读值得跟进有用关注 RLVR
10:04官方账号arXiv cs.LG@Takumi Shioda, Kohei Terashima, Tatsuo Nagai本研究采用带可验证奖励的强化学习(RLVR)微调开源推理模型,用于建筑热能存储调度。仅用30条训练提示,强化微调(RFT)将排放从70.5降至61.2 kg-CO2,接近动态规划最优值60.8。GPT-5无需微调即接近最优,而GPT-4o(非推理模型)排放高于无存储基线。分析表明,RFT主要稳定了候选比较、前瞻和可行性检查等规划模式,并在预测误差和未见条件下保持鲁棒。论文RLVRRFTGPT-5推荐理由:这篇论文用30条提示微调开源模型,让建筑冷负荷调度排放从70.5降到61.2,逼近最优,比GPT-4o强得多。原文稍后读已读值得跟进有用关注 RLVR
10:25官方账号arXiv cs.AI@Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas该论文提出对抗生成器-判别器框架,将可验证奖励(RLVR)与人类演示信号结合。在bug修复任务中,该方法在匹配RLVR基线性能的同时,将编辑距离显著降低。在故事生成任务中,该方法将胜率提升,并产出更接近人类的多样故事。在奖励黑客基准测试中,该方法几乎消除模型异常行为,同时保持高分。论文RLVR对抗训练语言模型训练推荐理由:这篇论文能让AI不仅算对答案,还能写出像人话的风格,用对抗训练把RLVR和人类示范结合起来,效果很实在。原文稍后读已读值得跟进有用关注 RLVR
12:01官方一手arXiv: DeepSeek@Pengxiang Cai, Tianchen Fang, Xiaohan Li, Qingyuan Zeng, Guocong Li, Jintai Chen精选传统RLVR方法仅重新分配采样概率,虽能提升pass@1但可能降低pass@k,无法扩展基础模型的推理能力边界。本文提出边界感知课程RL:先用pass@k采样定位当前推理边界,再对边界附近样本进行教师引导,最后用RL巩固新推理模式。在Qwen、Llama、DeepSeek等模型上,该方法在pass@256上平均比基础模型提升9.8个百分点,比Vanilla RLVR提升10.3个百分点。实验表明该策略可帮助LLM持续突破经验推理边界。论文课程强化学习LLM推理RLVR推荐理由:这篇论文提出一种课程强化学习,能帮LLM突破自己的推理能力边界,在多个模型上效果显著,值得关注。原文稍后读已读值得跟进有用关注 课程强化学习
09:22官方一手arXiv: DeepSeek@Siddharth Aphale, Kelly Liu一项研究分析了SFT(监督微调)的过度训练对RLVR(基于强化学习的验证)训练的影响。使用Qwen2.5-Coder-3B和DeepSeek-Coder-6.7B模型,发现SFT深度增加时,预RL的pass@1上升,但GRPO的pass@10从0.806降至0.481(3种子均值,n=20)。预RL熵与GRPO结果正相关(ρ=+0.69)。研究者提出一个两阶段诊断方法,结合预RL熵筛选和早期GRPO熵监控,可标记高风险检查点。简单KL正则化和标签平滑无法挽救已崩溃的检查点。论文Qwen2.5-Coder-3BDeepSeek-Coder-6.7BSFT推荐理由:这篇论文发现了SFT过训练会搞崩GRPO训练的秘密,还给出了诊断方法来提前止损。做RLHF或强化学习训练的可以看看。原文稍后读已读值得跟进有用关注 Qwen2.5-Coder-3B
10:26官方账号arXiv cs.AI@Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li精选论文提出PAEC(位置感知熵校准)方法,解决强化学习(RLVR)中策略熵过早崩溃的问题。传统全局熵正则化对所有位置均匀增加熵,在长推理轨迹中效率低下。PAEC通过局部top-p熵和top-two候选竞争构建软掩码,对决策敏感位置施加基于锚点的下界惩罚,防止这些位置的熵崩溃。在五个数学推理基准测试中,PAEC相比强RLVR基线提升了多数投票的宏平均性能,尤其在AIME类任务上增益明显。结果表明,推理RL中的熵管理应聚焦于决策敏感位置的选择性探索,而非均匀随机注入。论文强化学习推理模型熵校准推荐理由:做LLM推理强化学习的团队终于有了更精细的熵控制方案——PAEC在数学推理任务上直接提升多数投票性能,做RLVR的开发者值得关注这个位置感知的新思路。原文稍后读已读值得跟进有用关注 强化学习
16:35官方一手marktechpost@Sana Hassan本文是一篇技术教程,详细介绍了如何使用 TuringEnterprises/Open-MM-RL 数据集构建完整的多模态强化学习与可验证奖励(RLVR)管线。教程涵盖数据集加载、模式检查、领域分析、问题长度与答案类型统计、图像分布可视化等预处理步骤。还构建了轻量级奖励函数,支持精确匹配与语义评分,并演示了 GRPO 导出流程。该管线为多模态推理任务提供了可复现的实践框架,适合研究者和开发者快速上手。论文多模态强化学习RLVR推荐理由:多模态 RLVR 是当前强化学习与视觉语言结合的热点方向,这篇教程从数据集到奖励函数再到导出一步到位,做多模态推理或 RL 研究的团队可以直接照着搭,省去自己踩坑的时间。原文稍后读已读值得跟进有用关注 多模态
12:11官方账号arXiv cs.LG@Kaiyi Zhang, Wei Wu, Yankai Lin精选DelTA提出了一种新方法,解决强化学习从可验证奖励(RLVR)中训练大语言模型时,token级信用分配不准确的问题。研究发现,标准RLVR更新中,高频格式token会主导梯度方向,掩盖真正区分高/低奖励的关键token。DelTA通过估计token系数,放大判别性方向、抑制共享模式,使更新更聚焦于推理关键步骤。在7个数学基准上,DelTA在Qwen3-8B和14B上分别平均提升3.26和2.62分,代码生成和跨领域任务也验证了其泛化能力。论文强化学习Token信用分配推理模型推荐理由:做RLHF或推理模型训练的团队,终于有了一个能精准分配token级信用的方法——DelTA解决了高频格式token淹没关键信号的问题,数学和代码任务上效果显著,值得在自家模型上试试。原文稍后读已读值得跟进有用关注 强化学习
10:22官方账号arXiv cs.LG@Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu精选72°Group Relative Policy Optimization (GRPO) 在提升大语言模型推理能力方面表现出色,但存在优势坍塌问题:当组内奖励同质化(如全对或全错)时,优势趋近于零,导致梯度消失。研究者首次提出诊断指标 Advantage Collapse Rate (ACR),量化训练批次中梯度无效的比例,并在0.5B至14B参数模型上验证了ACR对训练停滞和最终性能的强预测性。为缓解该问题,他们提出 Adaptive Virtual Sample Policy Optimization (AVSPO),通过实时ACR监控注入虚拟奖励样本,无需额外模型推理即可从同质组中学习。AVSPO将优势坍塌减少58-63%,在所有模型规模上带来4-6个百分点的准确率提升,且保持了域外泛化能力。代码和数据集已开源。论文GRPO优势坍塌RLVR推荐理由:GRPO用户终于有了解决训练停滞的实用工具——AVSPO无需额外推理成本就能提升4-6个点准确率,做大模型RL训练的团队可以直接试。原文稍后读已读值得跟进有用关注 GRPO
15:34官方账号arXiv cs.AI@Utkarsh Tyagi, Xingang Guo, MohammadHossein Rezaei, Daniel George, Anas Mahmoud, Jackson Lee, Bing Liu, Yunzhong He精选强化学习中的可验证奖励(RLVR)在自动检查正确性时很有效,但许多模型行为需要同时满足多个定性标准。基于评分标准的奖励(rubric-based rewards)通过聚合多个标准来解决这一问题,但静态聚合会混淆人类赋予的重要性和当前优化信号的有效性。研究人员提出POW3R框架,它能在训练过程中动态调整各标准的奖励权重,优先关注当前能区分模型输出的标准。实验表明,POW3R在30个基线策略/指标比较中赢了24个,平均奖励和严格完成率均优于传统方法,且训练速度提升2.5-4倍。论文强化学习奖励设计RLVR推荐理由:做RLHF或RLVR的团队终于有了更聪明的奖励设计——POW3R解决了静态评分标准浪费训练信号的问题,做多模态或文本模型对齐的开发者可以直接参考实验设置。原文稍后读已读值得跟进有用关注 强化学习
10:44官方一手arXiv: DeepSeek@Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li精选GoLongRL 是一个完全开源的长上下文强化学习训练方案,包含 23K 样本的数据集、完整构建流程和训练代码。该方案基于长上下文能力分类法,覆盖 9 种任务类型,每个任务配有自然评估指标,数据来源包括书籍、学术论文和多轮对话等真实文档。在相同 GRPO 设置下,GoLongRL 数据集优于闭源的 QwenLong-L1.5 数据集,且 Qwen3-30B-A3B 模型在长上下文任务上表现接近 DeepSeek-R1-0528 和 Qwen3-235B-A22B。此外,论文提出 TMN-Reweight 方法,通过任务级均值归一化和难度自适应加权,解决异构奖励优化问题,进一步提升平均性能并保持通用能力。论文长上下文强化学习开源/仓库推荐理由:长上下文 RL 训练的数据构建和奖励设计一直是个难题,GoLongRL 提供了开源数据集和优化方法,做长上下文模型训练的团队可以直接复用,省去大量数据构造工作。原文稍后读已读值得跟进有用关注 长上下文