05:25Latent.Space@latentspacepod在OPSD相关研究中,针对Continual Learning领域的遗留数据问题展开深入讨论;@rronak_团队阐述GRPO方法的局限性并提出调整方案;此次讨论会为行业研究者提供了专业的交流平台。论文OPSDContinual LearningGRPO推荐理由:@rronak_团队讲了GRPO在Continual Learning里的改进思路,想了解行业前沿的人可以去听听。原文稍后读已读值得跟进有用关注 OPSD
10:16官方账号arXiv cs.LG@Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison论文提出两种互补策略改进价值函数强化学习:特权价值函数(PVF)在不偏置策略目标的前提下注入额外token级信号;TETHER则根据价值函数准确性自适应地在组相对基线和价值基线之间插值。在多个推理任务上,这两种策略均稳定优于标准价值函数基线,并与平均基线GRPO相比具有竞争力或更优。论文LLMGRPO强化学习推荐理由:这论文提了两个新招PVF和TETHER,给LLM强化学习用的,比标准价值函数强,和GRPO差不多甚至更好,搞RL的可以看看。原文稍后读已读值得跟进有用关注 LLM
12:34官方账号arXiv cs.LG@Vatsal Venkatkrishna, Nico Daheim, Iryna GurevycharXiv新论文提出参数空间探索方法3PO(Perturbed Parameter Policy Optimization),通过从后验分布采样不同策略生成rollout,补充传统动作空间探索的不足。在OLMo-3-1025-7B和Qwen2.5-Math-7B上,3PO在数学推理和代码生成任务中平均性能优于标准GRPO,且FLOPs成本几乎相同。多参数采样还减少了训练中零优势组和错误rollout的数量。论文3POGRPO参数空间探索推荐理由:想提升LLM强化学习效果?3PO用参数采样替代温度调节,在OLMo和Qwen上比GRPO更稳更好,成本还一样。原文稍后读已读值得跟进有用关注 3PO
11:37官方账号arXiv cs.AI@Yubo Jiang, Fengying Xie, Zhiguo Jiang, Haopeng ZhangSKALD 是一种基于策略的自蒸馏框架,使用 Qwen3-Base 模型的两种上下文视图:仅问题的学生和基于抽象技能卡的教师。该方法通过退火指数倾斜目标稳定分布失配,并在验证奖励为正时激活蒸馏。在五个数学基准上,SKALD 在 0.6B、1.7B 和 4B 规模下分别比 GRPO 提升 +2.46、+4.85 和 +12.01 的 avg@8。在 1.7B 规模下,零方差蒸馏恢复 84.7% 的完整增益,且比 FLOP 匹配的 GRPO 高 +4.06。论文SKALDQwen3GRPO推荐理由:想提升数学推理模型?SKALD 把技能蒸馏进权重,比 GRPO 最高涨 12 分,还不用改推理时的输入。原文稍后读已读值得跟进有用关注 SKALD
11:21官方账号arXiv cs.AI@Ananya Sahu, Mohit Bansal, Elias Stengel-EskinCreativeInstruct是一种可扩展的指令微调方法,通过让模型学习注入[StartCreativity]标记来平衡创造性与后训练质量。该方法引入基于图编辑距离的结构多样性指标,捕捉叙事层面的变化。在叙事生成任务中,CreativeInstruct匹配或超过了多模型基线及蒸馏变体的多样性,且无需牺牲质量。人工评估中,70.3%的评分者认为CreativeInstruct的生成比后训练模型更有创造力。将GRPO应用于CreativeInstruct检查点,在AMC上提升约4%,在MATH上提升约5个百分点。论文CreativeInstructGRPO指令微调推荐理由:CreativeInstruct用特殊标记让模型在保持质量的同时更会编故事,人类测评七成认为更有创造力,还能给强化学习带来几个点的提升。原文稍后读已读值得跟进有用关注 CreativeInstruct
10:43官方账号arXiv cs.LG@Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao ZhangTRIAL提出统一回合对齐评分协议,为每个决策回合提取结果视图并比较普通与事后条件下的响应,以有符号对数概率差分配标记级监督。在WebShop和ALFWorld上使用不同骨干模型,TRIAL在全部八种组合中超越GRPO,并在六种组合中达到最优或并列最优。使用Qwen3-1.7B时,WebShop成功率从56.4%提升至75.2%,任务分数从78.7%提升至85.7%。消融实验显示,轨迹相对的回合分配比单纯密集事后蒸馏带来更大提升。论文TRIALGRPOQwen3推荐理由:这个新框架TRIAL能让智能体强化学习更高效,在多个任务上超过GRPO,成功率提升近19个百分点,搞RL的可以看看。原文稍后读已读值得跟进有用关注 TRIAL
10:02官方账号arXiv cs.LG@Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui精选SpecRoll 是一种用于强化学习 rollout 的投机解码引擎,面向大规模语言模型后训练。它用轻量级未来 token 头生成并行提议,并通过 Reflex 模块做轨迹局部的隐藏状态修正,无需反向传播。在 1.5B 到 14B 的五个模型和三个数学推理数据集上,SpecRoll 相比原始 GRPO 取得 1.26-2.15 倍生成加速和 1.21-2.04 倍端到端加速。在全部 15 组匹配设置中,SpecRoll 的平均端到端耗时比 FastGRPO 快 1.18 倍。源码已公开。论文SpecRollGRPO投机解码推荐理由:RL 训练嫌生成太慢?SpecRoll 用投机解码给 rollout 提速,不改采样分布,五个模型跑数学推理端到端快 1.2 倍以上,代码也开源了。原文稍后读已读值得跟进有用关注 SpecRoll
12:27官方账号arXiv cs.AI@Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao论文提出 Video-DeepResearch,将多模态智能体从静态图像扩展到连续视频流,要求密集时空定位与开放网页探索结合。在 Video-DR-Bench 基准上,Video-DeepResearch-35B-A3B 平均准确率达 64.0%,超过 Claude-4.5-Sonnet(59.0%)5.0 个百分点,也优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。框架采用解耦的感知-探索流程,通过分阶段工具解锁强制跨帧视觉定位后再进行网页检索。训练结合监督微调与 GRPO,30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当。代码已开源。论文Video-DeepResearch多模态智能体推荐理由:Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。原文稍后读已读值得跟进有用关注 Video-DeepResearch
09:52官方账号arXiv cs.AI@Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan现有GRPO等组相对强化学习方法只提供响应级监督,与结构化多目标预测存在粒度失配。MCR-GRPO通过留一比较估计每个预测框的边际贡献,并利用连续匹配集值评估器改进归一化与定位。在REC、DOD、分割和计数基准上,该方法超越了现有GRPO基线。论文MCR-GRPOGRPO多模态推荐理由:GRPO以前只看整体得分,现在MCR-GRPO能逐个框算功劳,定位和分割都更准了。原文稍后读已读值得跟进有用关注 MCR-GRPO
09:21官方账号arXiv cs.AI@Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav RappoportMedUPS 是一个针对罕见病例诊断决策的对齐框架,配套数据集 MedUPSQA 包含 21,874 个临床决策点,来自 5,535 份真实病例报告。该框架将病例文本按时间顺序切分成累积片段,用 GRPO 强化学习训练模型预测下一步行动,并以 LLM-as-a-Judge 作为奖励。在三个基座模型上,中间步骤对齐将下一步预测准确率从 55.2 提升至 66.7(Qwen3.6-27B)、从 47.2 提升至 57.8(Qwen3.5-9B)、从 37.8 提升至 44.4(HuatuoGPT-3-8B)。MedUPSQA 数据集、代码和对齐后的模型权重已发布。论文MedUPSMedUPSQAQwen推荐理由:MedUPS 用强化学习教模型在罕见病例中预测下一步决策,三个开源模型准确率都提升了,数据集和代码已开源。原文稍后读已读值得跟进有用关注 MedUPS
11:55官方账号arXiv cs.AI@Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong CaiMemHarness 框架在决策时用统一策略模型批判并重构检索到的经验,而不是像基线那样逐字回放。重构能力通过 GRPO 端到端训练自然涌现,无需额外监督。在 ALFWorld 和 WebShop 两个基准上,MemHarness 显著超过纯 RL 和静态记忆增强基线。分析表明,MemHarness 的重构目标可防止负迁移,并在 OOD 场景中保持鲁棒性。论文MemHarnessALFWorldWebShop推荐理由:MemHarness 让智能体把旧经验改写到当前场景再用,在 ALFWorld 和 WebShop 上比静态记忆基线强不少。原文稍后读已读值得跟进有用关注 MemHarness
11:28官方账号arXiv cs.LG@Tiangang Li, Xiangbo TianSFT虽能让LLM掌握HPC领域知识,但在数据竞争检测与基准问答上行为不精准,88.65%的分类正确率下仍有65.9%的MLPerf回答超40字符。HPC任务异构性显著,答案长度差异达58倍,覆盖三种奖励分布。HARGO通过置信度调制的优势加权,无需任务类型标签即可适配。在四个HPC任务和九种方法的对比中,HARGO在WinRate 54.62%、Data Race F1 91.30%和PLP Similarity 0.8558上均取得最佳。AI模型HARGOHPCRL后训练推荐理由:HARGO给HPC任务的RL后训练提了个新思路,不用标签就能按难度加权,四个任务上全面超过GRPO。原文稍后读已读值得跟进有用关注 HARGO
10:10官方一手arXiv: DeepSeek@Ken Ding精选数学推理的RLVR存在盲区:当一组采样全部失败时,GRPO的优势函数为零,导致模型在能力边界提示上无梯度。LSPO在每个RL步检测这类悬崖提示,用其标准答案快速拟合一个小型LoRA适配器,然后重新采样并将成功补全拼回批次。在DeepMath-103K上用DeepSeek-R1-Distill-Qwen-1.5B、n=5配对种子、1000步评估,LSPO在16个(基准,pass@k)组合中15胜1平,AIME24/pass@4提升+10.7点,MATH500/pass@1提升+2.4点,平均提升+3.8点。论文DeepSeek-R1-Distill-Qwen-1.5BGRPOLoRA推荐理由:DeepSeek-R1-Distill-Qwen-1.5B上,LSPO用LoRA支架捡回GRPO在零奖励提示上的梯度,比DAPO平均高3.8个点。原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-1.5B
11:40官方账号arXiv cs.AI@Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang论文研究多仓库库存分配中MIP公式的实例级选择问题,提出一种求解器引导的LLM框架,通过SFT、IPO和GRPO训练选择器。实验基于京东数据,Hit Ratio@1从21.45%提升至50.42%,Hit Ratio@2从70.47%提升至82.31%,分配质量比固定最优公式高12.57个百分点,与事后最优差距缩小至4.85个百分点。论文LLMGRPO多仓库库存分配推荐理由:京东数据验证的一种新方法,用LLM和GRPO自动选库存分配公式,准确率翻倍,搞供应链优化的可以关注。原文稍后读已读值得跟进有用关注 LLM
11:28官方账号arXiv cs.LG@Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve论文提出DMC-Optim基准,用于评估代码优化RL。通过三阶段方法解决测量噪声和奖励稀疏问题:构建校准沙箱测试,组合正确性与速度奖励,并适配GRPO到稀疏场景。在DMC-Optim上,Qwen 2.5 7B的top-50% pass@1从18.0%提升至31.3%,CWM 32B从30.7%提升至50.4%。top-30%时CWM 32B相对提升125%,且保持纯正确性分数不变。在LCB上,CWM 32B赢得83%的中位数样本速度对比。论文DMC-OptimGRPO代码优化推荐理由:一篇教你用强化学习优化代码执行速度的论文,针对测量噪声和奖励稀疏问题设计了DMC-Optim基准和三阶段方法,让Qwen 2.5 7B的pass@1从18%提到31%,CWM 32B提到50%。原文稍后读已读值得跟进有用关注 DMC-Optim
12:01官方一手arXiv: DeepSeek@Fei Ding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Huiming YangGRPO 被 DeepSeek-R1 采用作为训练推理能力的主要强化学习算法,但存在响应级长度偏差。最新改进 Dr. GRPO(COLM 2025)声称通过移除长度归一化实现“无偏”,但作者证明该声称不完整。文章提出不可能定理:在标准结果奖励加 GRPO 设定下,没有长度加权方案能同时实现梯度无偏估计(P1)和长度不变性(P2)。通过参数族 f_α(L)=L^{α-1} 显示,α=0 对应 GRPO(近似满足 P2 但违反 P1),α=1 对应 Dr. GRPO(满足 P1 但违反 P2),且 Dr. GRPO 的长度偏差导致较长轨迹的梯度贡献与长度比成正比。结果表明两种算法处于不可避免的权衡两端。论文GRPODr. GRPODeepSeek-R1推荐理由:这篇论文把 GRPO 和 Dr. GRPO 的底裤都扒了——原来两者各占一个极端,没法同时做到无偏和长度无关,搞推理模型训练的人得看看这个权衡。原文稍后读已读值得跟进有用关注 GRPO
11:55官方账号arXiv cs.LG@Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao论文提出统一多轮环境,系统研究规划能力在预训练与后训练三阶段的获取、塑造与整合。预训练中,显式世界模型通过CoT状态转换建模提升长程泛化,少量长程数据即可实现组合泛化,但次优轨迹因误差累积严重损害性能。后训练中,OPD在低质长程设置下的有效区域比GRPO更广,不同知识的教师蒸馏可能损害学生先验世界模型。多教师在线策略蒸馏(MOPD)通过收敛到共享规划模式整合能力,兼容模式支持跨环境泛化,冲突模式导致干扰。论文MOPDGRPOOPD推荐理由:这篇用一个可控环境拆解了AI长程规划的训练机制,发现次优数据会拖累性能,多教师蒸馏能整合不同能力,值得做训练方法的人细读。原文稍后读已读值得跟进有用关注 MOPD
12:06官方账号arXiv cs.LG@Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi标准RLVR在模型无法生成任何正确答案时会得到零学习信号,导致困难问题无法收敛。Off-Context GRPO通过在训练中引入解法前缀作为特权引导,使模型获得非零奖励。该方法通过重要性校正目标避免引导与原始目标的偏差,在标准数学推理基准上比vanilla GRPO平均绝对提升3.9%(相对提升13.8%),且额外成本可忽略。论文Off-Context GRPOGRPORLVR推荐理由:模型一遇到难题就原地踏步?这篇论文给出了一个简单又有效的解法:给模型一点'提示',效果直接涨3.9%,成本几乎为零。原文稍后读已读值得跟进有用关注 Off-Context GRPO
18:37Geek@geekbb精选该教程逐行解析 MiniMind 源码,涵盖 Tokenizer、模型结构、预训练、SFT、DPO、PPO、GRPO 共 10 章内容,每章标注对应源码文件和函数名。附录17篇进阶文章补充量化、投机解码、RLHF 等 MiniMind 未涉及的主题。适合希望从代码层面理解大模型全流程的读者。技巧MiniMind源码预训练推荐理由:想用代码搞懂大模型训练全流程?这个教程把 MiniMind 的源码一行行讲透,从 Tokenizer 到 GRPO 都有,还附赠量化、RLHF 等进阶知识。原文稍后读已读值得跟进有用关注 MiniMind
11:55官方账号arXiv cs.LG@Chinmay Rane, Kanishka Tyagi, Michael Manry本文提出Output Reset(OR)作为PPO和GRPO中裁剪替代目标的平滑替代方案,使用OR平方边际损失在token对数比率空间进行优化。在Llama-3.2-1B-Instruct模型上基于Anthropic hh-rlhf数据集测试,PPO-OR在广义优势估计下最终奖励模型得分比PPO-clip平均高0.305,但seed间方差更大。GRPO-OR在组相对优势下平均得分未提升,但方差更小且过冲分数下降。两种组相对方法均比GAE方法产生更大的rollout到当前对数比率位移,OR未能一致减少此位移。报告分数为训练时奖励模型测量值,非独立人类偏好表现。论文ORPPOGRPO3 个信源在谈事件专题推荐理由:这篇论文用OR替换PPO和GRPO的裁剪目标,在Llama-3.2上奖励得分有提升,适合想了解强化学习微调新思路的同学原文稍后读已读值得跟进有用关注 OR
10:41官方账号arXiv cs.AI@Xingjian Tao, Yiwei Wang, Yujun Cai, Jing TangLenGuard-GPC是一种密集奖励框架,针对多视图空间推理中标准GRPO奖励稀疏且无法控制推理长度的问题。它通过比较标准提示与引导提示下token级预测分布的KL散度,提供密集奖励信号。同时引入分阶段长度奖励,将推理长度控制在合理范围,避免简单鼓励短回答。在6项多视图空间推理基准上,LenGuard-GPC相比原始GRPO提升了准确率,同时降低了平均响应长度。论文LenGuard-GPCGRPO空间推理推荐理由:这篇论文用KL散度做密集奖励,还加了长度控制,空间推理上比GRPO更准更短,值得搞强化学习的人看看。原文稍后读已读值得跟进有用关注 LenGuard-GPC
09:31官方账号arXiv cs.AI@Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji WangAnthroDial是一个闭环框架,将拟人对话的生成、评估和偏好对齐联合建模。其运行时结合角色条件调度、长时记忆和虚拟时间;评测包含L0有效性门控、5个每轮维度和5个对话级维度。后训练管线用16,436个调度决策示例做SFT,并采用GRPO与认知诊断ZPD感知奖励,通过Kalman滤波对每个行为维度进行能力估计并加权。在55个角色、50个场景、50个角色-场景绑定、每模型100个角色条件案例的基准上,评估了16个系统,Qwen3.6-27B-SFT+RL达到39.00%严格ACC和98.5总分。9B无思考设置下,SFT和RL将严格ACC从0.00%提升到13.00%和18.37%。论文AnthroDialQwenGRPO推荐理由:这篇论文把拟人对话的生成、评测和奖励对齐做成闭环,Qwen3.6-27B微调后严格准确率39%,比基线高一大截。原文稍后读已读值得跟进有用关注 AnthroDial
09:31官方账号arXiv cs.AI@Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang多模态科学声明验证需依托论文中的图表、表格等视觉证据。现有方法在定位关键视觉证据、准确读取结构化科学图表、整合多模态观察方面存在不足。本文提出首个工具增强框架ToolSciVer,为视觉语言模型(VLM)配备三种类型感知视觉工具:表格行列聚焦、图表结构化解析、高分辨率区域放大。采用分组相对策略优化(GRPO)训练策略,综合奖励答案正确性、格式、长度、工具使用效率及有效性。在SciVer和MuSciClaims数据集上基于Qwen、InternVL、Gemma三个系列的五个VLM进行实验,结果表明该方法优于包括提示词和强化学习方法在内的四个基线。论文ToolSciVer多模态科学声明验证推荐理由:这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。原文稍后读已读值得跟进有用关注 ToolSciVer
09:22官方账号arXiv cs.LG@Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng JinLongStraw 是一种针对百万token级别强化学习后训练的架构感知执行栈,基于 GRPO 实现,在固定 GPU 预算下运行。它通过共享提示无自动求导评估、仅保留模型特定状态并逐次重放短响应分支,将实时训练图缩小以换取重放时间。在 8 块 H20 GPU 上,LongStraw 完成了 2.1M 位置的分组 Qwen 评分和响应反向传播;分组数从 2 增至 8 时,峰值显存仅增加 0.21 GB。在 32 块 H20 GPU 上,端到端执行路径验证了 GLM-5.2 全部 78 层的 2.1M token 提示处理能力。这些实验证明了执行容量,但完整训练正确性尚未全面验证。论文LongStrawGRPOQwen推荐理由:LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。原文稍后读已读值得跟进有用关注 LongStraw
09:54官方账号arXiv cs.LG@Vladislav Beliaev精选AdaPrefix-GRPO针对GRPO在困难问题上梯度消失的问题,提出自适应调整正确前缀长度的机制。方法通过反馈控制器将问题的成功率维持在50%附近以最大化梯度信号,训练后完全移除前缀。在0.6B模型上,该方法在保留训练分布的难题上将准确率提升2.1倍;在Qwen3-1.7B上提升1.6倍,在AIME基准上提升1.7倍,同时将追踪长度减半。模型越小,增益越大。论文AdaPrefix-GRPOGRPOQwen3推荐理由:这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。原文稍后读已读值得跟进有用关注 AdaPrefix-GRPO
09:14官方账号arXiv cs.AI@Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong提出Single-rollout Asynchronous Optimization (SAO)方法,解决异步RL中GRPO框架不适用于智能体任务的稳定性和离策略问题。用单轨迹采样替代组采样,配合价值模型训练和双面token级裁剪,在SWE-Bench Verified、BeyondAIME、IMOAnswerBench上持续优于GRPO及其变体。SAO已成功部署于GLM-5.2模型(750B-A40B)的智能体RL训练管线。论文SAOGRPOGLM-5.2推荐理由:想高效训练智能体模型?SAO用单轨迹采样打补丁,稳定训练1000步,在编码和推理基准上全面超越GRPO,干货论文。原文稍后读已读值得跟进有用关注 SAO
11:11官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz GeramifardTREK提出一种分阶段训练方法,解决GRPO在困难提示上的探索停滞问题。该方法先用蒸馏将教师模型(如DeepSeek-V4)的已验证轨迹拉入学生模型支持域,再返回标准GRPO精炼。在数学推理中,TREK将Qwen3-8B在AIME 2025上从36.9提升至40.3,在AIME 2024上从47.9提升至51.1(avg@16)。在代理任务上,ALFWorld成功率从75.8提高到82.8,ScienceWorld从12.5提高到26.7。TREK的泛化优势在于仅需已验证输出轨迹,可兼容黑盒或白盒教师。论文TREKGRPO蒸馏推荐理由:这篇论文给出了一个实用技巧:用蒸馏扩展支持域再强化学习,在数学和代理任务上都涨点明显,而且不需要改动模型结构。原文稍后读已读值得跟进有用关注 TREK
12:36官方一手marktechpost@Sana Hassan精选该教程展示了如何用Tunix框架和GRPO算法微调Gemma-3模型在GSM8K数学数据集上。首先配置环境并通过Hugging Face加载Gemma-3,将样本包装为推理加答案格式。定义格式正确性和数值正确性的奖励函数,并附加LoRA适配器以降低训练成本。最终通过GRPO分组采样改进策略,并导出合并后的模型。技巧Gemma-3GSM8KGRPO1 个信源在谈事件专题推荐理由:手把手教你用Tunix GRPO和LoRA微调Gemma-3做GSM8K数学题,奖励函数设计得很清楚。原文稍后读已读值得跟进有用关注 Gemma-3
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。论文Qwen3GRPOTransformer推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。原文稍后读已读值得跟进有用关注 Qwen3
12:22官方账号arXiv cs.LG@Michael Y. Li, Anthony Zhan, Kanishk Gandhi, Noah D. Goodman, Emily B. Fox论文提出QuasiMoTTo,利用准蒙特卡洛(QMC)生成相关但边际分布正确的样本,替换传统的独立同分布(i.i.d.)采样,减少冗余。在四个推理基准上,QuasiMoTTo以25-47%更少的样本达到相同的pass@k准确率,甚至常饱和边际保持采样器的理论上限。应用于策略梯度强化学习(GRPO)时,QuasiMoTTo以50%更少的训练步骤匹配i.i.d.性能。研究者还开发了无偏bootstrap估计器以评估相关采样器的pass@k。论文QuasiMoTToquasi-Monte Carlopass@k推荐理由:这篇论文提出QuasiMoTTo,用相关采样替代独立采样,在推理和强化学习中大幅减少样本需求,效果显著。原文稍后读已读值得跟进有用关注 QuasiMoTTo
11:50官方账号arXiv cs.LG@Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi该论文研究异步GRPO(群体相对策略优化)中陈旧rollout对策略优化的影响。作者将行为策略显式纳入GRPO替代目标,并区分学习器使用的替代梯度映射与依赖分布的总体目标的真实全导数。在局部有界性、分布平滑性和行为策略平滑性假设下,证明陈旧rollout引入的每步替代梯度偏差为O(S * eta),其中S是最大rollout滞后,eta是学习率。进一步导出条件性崩溃时间缩放定律:当周期内漂移低于批量级裁剪半径时,崩溃主要由累积学习器漂移T * eta决定;当陈旧rollout约束激活时,稳定性显式依赖于S * eta。从而得到双约束稳定性条件eta << min{R_batch/(S*G_upd), R_crit/(T*G_upd)},解释了在有限时间范围内最大稳定学习率对陈旧性依赖较弱的原因。论文RLHFGRPO异步训练推荐理由:想搞异步RLHF训练的可以看这篇,把陈旧rollout对学习率的影响定量化了,推导了缩放条件,比经验调参更靠谱。原文稍后读已读值得跟进有用关注 RLHF
10:36官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard论文提出TRIAGE框架,通过将动作段分类为决断性进展、有用探索、无进展基础设施或回归,并分配固定边界奖励,解决了标准GRPO仅依赖最终结果信号的盲点。在ALFWorld、Search-QA和WebShop三个基准上,TRIAGE基于两种策略模型均提升了成功率。消融实验表明,角色类型化(尤其是检测成功轨迹中的回归行为)是性能提升的主要来源,且TRIAGE在ALFWorld和WebShop上分别比GRPO减少了10.4%和14.8%的环境交互轮次。论文TRIAGEGRPOALFWorld推荐理由:想改进智能体强化学习的信用分配?TRIAGE通过角色类型化标签给不同动作段不同奖励,效果超过GRPO,还能少绕弯路。原文稍后读已读值得跟进有用关注 TRIAGE
10:08官方账号arXiv cs.AI@Difan Jiao, Raghav Singhal, Robert West, Ashton AndersonTandem Reinforcement Learning (TRL) 将 tandem 训练范式引入带可验证奖励的强化学习(RLVR)。TRL 让一个较强的 senior 模型与一个冻结的 junior 模型随机交替协作生成推理过程,对最终结果给予奖励,并对 senior 应用标准 GRPO 损失。在 Qwen3-4B-Instruct 上使用竞赛数学训练,TRL 的 solo 推理能力与 vanilla GRPO 持平,但同时提升了 senior 与 junior 的交接鲁棒性、减少了 junior 侧分布漂移,并产出了对 junior 更易理解的思维链。该工作为多模型通信与人类兼容性提供了实际收益的路径。AI模型TRLQwen3-4BGRPO推荐理由:他们提出了 TRL,让强模型和弱模型组队推理,强模型学会写弱模型能看懂的推理过程。训练 Qwen3-4B 后,单打能力不降,协作能力更强。原文稍后读已读值得跟进有用关注 TRL
10:35官方账号arXiv cs.LG@Ping Liu, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Rajat Arora, Yunxiang Ren, Chunnan Yao, Dan Xu, Baofen Zheng, Wanjun Jiang, Andrii Soviak, Kevin Kao, Jingwei Wu, Wenjing Zhang该论文提出一种RLAIF框架为招聘搜索平台自动生成可移植的搜索查询词。研究发现GRPO优化器对虚假奖励信号敏感,易导致模型复制原文的退化行为。通过引入基于规则的确定性奖励下限,抑制了动词复制行为,使交叉族评估指标提升0.147。实验表明训练时奖励模型将性能提升夸大了2.4倍,核心在于奖励塑形而非优化器选择。论文RLAIFGRPO语义搜索推荐理由:这篇论文揭示了奖励信号设计比选优化器更重要,GRPO容易作弊,加个规则防御就能让质量跳升14.7%点。原文稍后读已读值得跟进有用关注 RLAIF
08:55Fireworks AI@FireworksAI_HQ精选Fireworks 宣布对 NVIDIA Nemotron 3 的强化学习微调功能上线,首批支持 Nemotron 3 Super 的 LoRA 微调。训练采用 GRPO 算法,可在一处平台完成训练和部署。计费方式改为按 GPU 小时而非按 token,解决了长多轮对话成本不可控的问题。AI产品Nemotron 3Fireworks微调6 个信源在谈事件专题推荐理由:Fireworks 刚上线了 Nemotron 3 的 RL 微调,按 GPU 小时计费不怕长对话烧钱,用 GRPO 训练一条龙搞定。原文稍后读已读值得跟进有用关注 Nemotron 3
12:56官方账号arXiv cs.AI@Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman72°SPIRAL提出一种新训练框架,让语言模型在推理时同时使用顺序链式思维、平行采样和最终聚合三种原语。该方法通过集束强化学习优化所有组件,在推理任务中扩展效果优于GRPO,最高实现11倍扩展效率和15%性能提升。实验表明模型能有效学习生成对聚合有用的轨迹集并改进最终答案。论文SPIRALGRPO推理模型推荐理由:这篇论文的SPIRAL方法教模型自己学会并行思考再汇总,比单纯加大顺序推理高效11倍,效果还更好,值得做推理扩展的朋友看看。原文稍后读已读值得跟进有用关注 SPIRAL
23:54elvis@omarsar0精选论文提出三阶段流水线,从GUI轨迹中分段、聚类候选技能并训练技能感知策略。八个聚类中五个纯度≥0.95。但GRPO仅将技能步准确率从18.5%提升至20.5%,低于频率先验。作者指出弱边界检测器、无序段表示和离线奖励模型是三大原因。论文SKILL.mdCodexOpenAI10 个信源在谈事件专题推荐理由:这篇论文用OpenAI Codex的思路做智能体技能提取,八个聚类五个纯度超0.95,但GRPO只提了2个点,分析很实在。原文稍后读已读值得跟进有用关注 SKILL.md
10:10官方账号arXiv cs.AI@Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng YANSPOT-E方法针对视觉语言模型在处理证据密集型任务时因小区域视觉证据被忽略导致的读取失败问题。该方法利用答案跨度预测熵作为模型内部反馈,通过低熵锚点和熵整形目标消除歧义,避免模型陷入捷径塌缩。SPOT-E基于GRPO进行每实例轻量级调优,生成问题条件化的聚光灯。在多个VLM族和基准测试中,SPOT-E一致提升了性能并增强了视觉损坏鲁棒性。代码已开源。论文SPOT-EVLMGRPO推荐理由:SPOT-E这个新方法挺有意思,它不重训模型,只在推理时搞了个视觉聚光灯和熵整形,就让VLM在那些需要细看局部证据的任务上表现好多了。尤其用GRPO调优,效果提升还挺稳定。原文稍后读已读值得跟进有用关注 SPOT-E
10:54官方账号arXiv cs.LG@Haipeng Luo, Qingfeng Sun, Songli Wu, Can Xu, Wenfeng Deng, Han Hu, Yansong TangSTARE针对GRPO等强化学习训练中策略熵崩溃问题,提出令牌级信用分配纠偏方法。通过惊讶度分位数识别熵关键令牌子集,选择性重加权其有效优势,并引入目标熵闭环门控实现稳定熵调节。在1.5B至32B规模模型及短CoT、长CoT、多轮工具使用三类任务中,STARE可维持数千步稳定训练。在AIME24和AIME25上,STARE准确率较DAPO等基线提升4%-8%,反射令牌和响应长度同步增长,表明探索-利用平衡得到改善。代码已开源。论文STAREGRPO策略熵推荐理由:STARE解决了GRPO训练中策略熵崩溃的老问题,在AIME数学竞赛上比DAPO高4-8个点,代码也开源了,搞RL训练的同学可以试试。原文稍后读已读值得跟进有用关注 STARE
09:47官方账号arXiv cs.AI@Ruishan Fang, Siyuan Lu, Chenyi Zhuang, Tao Lin多轮工具使用强化学习受限于静态数据集中信息样本快速耗尽的问题。研究观察到GRPO中梯度集中在高奖励方差任务上,基于Popoviciu上界。提出RODS方法,利用进度奖励方差作为零成本边界检测器,无需额外推理。通过技能对齐重采样管道合成新多轮变体,维护动态缓冲池。从400个人工种子开始,保持约800样本活跃池,达到与17K样本离线管道相当性能,轨迹数减少约20倍。论文RODSGRPO工具使用智能体推荐理由:这篇论文用奖励方差自动发现困难样本并生成新数据,训练效率比静态数据高20倍,特别适合多轮工具智能体场景。原文稍后读已读值得跟进有用关注 RODS