8月6日
11:16
11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu
RAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。
推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。
09:49
09:49官方账号arXiv cs.AI@Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo
WorldCycle提出用可逆动作循环解决视频世界模型的误差累积问题,无需标注即可验证长时程预测。该方法构造闭合动作循环,用空间闭合奖励和时间一致性奖励优化模型,使动作成为一致的状态算子。在CycleBench基准上,WorldCycle将状态返回漂移降低44%,复合动作准确率提升近4倍。
推荐理由:这篇论文用自验证循环替代人工标注,把世界模型的长期漂移降了44%,复合动作准确率翻近4倍,做视频生成或具身智能的可以看看。
09:28
09:28官方账号arXiv cs.LG@Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu
State2State是一种从环境交互中派生训练目标的方法,无需外部指定的任务或人工监督。它通过规则匹配状态来验证智能体是否到达目标状态,从而提供可扩展且可验证的训练信号。在ALFWorld和ScienceWorld基准上,State2State作为独立训练阶段在多数设置下提升了智能体性能。用作下游强化学习的初始化时,它进一步提高了最终性能和采样效率,并展现出跨环境泛化的潜力。
推荐理由:这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。
8月5日
12:31
12:31官方账号arXiv cs.AI@Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu
TurnSight 是一个面向工具集成推理(TIR)的回合级事后自蒸馏框架。TurnSight 不从轨迹级或令牌级反馈学习,而是基于执行条件的事后状态生成监督信号。TurnSight 构造多个不同前瞻视野的事后视图,并通过跨视野方向一致性筛选可靠信号。论文在三个基准上验证了效果,代码已开源在 GitHub。
推荐理由:TurnSight 把工具推理的强化学习拆到回合级,用事后视角筛信号,三个基准上都有效,代码开源了。
07:38
07:38IT之家博客/媒体
72°
马斯克在 SpaceX 财报电话会议上预告,Grok 4.6 将于下周发布,总参数量为 1.5 万亿。该模型重点改进监督微调(SFT)和强化学习(RL)技术。他还透露未来 3~4 周将推出 Grok 4.7,参数量达 2.1 万亿。

推荐理由:马斯克说 Grok 4.6 下周就来,1.5 万亿参数,重点改了监督微调和强化学习,可以先蹲一波。
8月4日
09:52
09:52官方账号arXiv cs.AI@Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan
现有GRPO等组相对强化学习方法只提供响应级监督,与结构化多目标预测存在粒度失配。MCR-GRPO通过留一比较估计每个预测框的边际贡献,并利用连续匹配集值评估器改进归一化与定位。在REC、DOD、分割和计数基准上,该方法超越了现有GRPO基线。
推荐理由:GRPO以前只看整体得分,现在MCR-GRPO能逐个框算功劳,定位和分割都更准了。
8月3日
7月29日
11:36
11:36官方账号arXiv cs.LG@Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst
论文提出Reinformed Dreamer算法,通过潜在引导改进不对称表示学习,解决了Informed Dreamer在特权信息表示上的局限。在多个强化学习基准测试中,相比Dreamer基线,Reinformed Dreamer表现出更一致的性能提升。该方法利用训练期间的额外监督信息学习更好的观察和特权信息表示。
推荐理由:如果你做强化学习,特别关注世界模型,这篇论文提出Reinformed Dreamer,用潜在引导训练不对称表示,比Informed Dreamer更稳定地超越Dreamer。
11:28
11:28官方账号arXiv cs.LG@Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoit Sagot, Gabriel Synnaeve
论文提出DMC-Optim基准,用于评估代码优化RL。通过三阶段方法解决测量噪声和奖励稀疏问题:构建校准沙箱测试,组合正确性与速度奖励,并适配GRPO到稀疏场景。在DMC-Optim上,Qwen 2.5 7B的top-50% pass@1从18.0%提升至31.3%,CWM 32B从30.7%提升至50.4%。top-30%时CWM 32B相对提升125%,且保持纯正确性分数不变。在LCB上,CWM 32B赢得83%的中位数样本速度对比。
推荐理由:一篇教你用强化学习优化代码执行速度的论文,针对测量噪声和奖励稀疏问题设计了DMC-Optim基准和三阶段方法,让Qwen 2.5 7B的pass@1从18%提到31%,CWM 32B提到50%。
03:00
00:11
00:11官方账号Hugging Face@huggingface
本教程来自HuggingFace的Training Agents系列第三期。内容讲解如何基于开源权重模型使用强化学习训练本地智能体。通过具体步骤演示训练流程,适合希望掌握智能体训练方法的开发者。
推荐理由:想自己训练AI智能体?HuggingFace出了第三期教程,教你用强化学习训练本地/开源模型当智能体,手把手实操。
7月28日
16:16
16:16官方一手Pandaily@contact@pandaily.com (Pandaily)
82°
Moonshot AI发布47页Kimi K3技术报告,核心架构包括KDA+Gated MLA混合注意力机制。AttnRes跨层检索层降低推理成本。Stable LatentMoE包含896个专家,支持动态路由。采用51.2M规模的RL沙箱进行强化学习训练,提升模型对齐能力。报告还引入模型参数与推理时间两个缩放轴,重新定义性能前沿。
事件专题

推荐理由:Moonshot AI 发了Kimi K3的47页技术报告,混合注意力、896专家MoE和5100万RL沙箱的架构特别硬核,值得看它怎么跟DeepSeek对标。
15:20
15:20AI Will@FinanceYF5
一条推特用户观点指出,Claude过去在“用起来舒服”方面是强项,但现在已被Grok和Kimi超越。该用户目前最喜欢Grok,并认为Kimi也不差。他观察到Anthropic和OpenAI正在降低RLHF的优先级,转而押注更容易规模化的RL方法。
事件专题

推荐理由:有个用户觉得Claude没以前好用了,现在更喜欢Grok和Kimi,还发现Anthropic和OpenAI都在押注RL而不是RLHF,挺有意思的观察。
11:00
11:00官方账号arXiv cs.AI@Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng
多模态大语言模型在推理任务中常出现中间步骤有缺陷但最终答案正确的问题,影响可解释性。论文提出O^2-CritiCuRL框架,在离线阶段通过多轮次分析步骤标注轨迹估计步骤重要性,提取关键推理步骤;在线阶段采用逐步强化学习策略,用截断链引导模型推理缺失步骤。在多个多模态推理基准上达到SOTA,同时训练和推理效率更高。代码已开源。
推荐理由:这篇论文提出了一种新方法,能解决多模态模型推理时中间步骤乱但结果对的问题,效果SOTA还更高效,做推理增强的可以看看。
10:35
10:35官方账号arXiv cs.AI@Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny
HyGAE是一种针对视觉-语言模型(VLM)智能体的强化学习框架,提出混合优势估计(Hybrid Advantage)和统一评价器(Unified Critic),同时优化令牌级和回合级目标。在五个多回合决策环境中的评估显示,HyGAE的平均成功率达到91%,相比其他方法提升了10%。理论分析表明,混合优势和回报的精确解析形式对优化至关重要。
推荐理由:这篇论文提出了HyGAE方法,让VLM智能体在多个回合的决策任务里表现更好,平均成功率91%,比别的方法高了10%,值得搞强化学习和多模态的研究者看看。
04:50
04:50官方一手marktechpost@Asif Razzaq
Moonshot AI的Kimi团队与kvcache-ai于7月27日开源AgentENV(AENV),采用MIT协议,作为Kimi K3开放日的一部分。该系统将Agent沙箱运行在Firecracker微虚拟机中,支持毫秒级快照、恢复和16路fork。它提供E2B兼容的API,用于大规模智能体强化学习训练。
事件专题

推荐理由:Kimi团队把内部训练智能体的分布式系统AgentENV开源了,支持毫秒级快照和16路fork,搞强化学习训练省事儿很多。
7月27日
12:21
12:21官方账号arXiv cs.AI@Anduel Mehmeti, Gabriella Gigante, Salvatore Venticinque
该论文探索可解释强化学习(RL)在空管(ATC)中的应用。研究人员在简化ATC环境中训练RL智能体,使其决策替代航线以规避禁飞区。他们采用显著图分析输入特征对智能体决策的影响,揭示关键因素。
推荐理由:想理解AI在空管这种高风险场景怎么解释自己?这篇论文用显著图告诉你智能体为什么选择某条航线,很实在。
7月24日
12:10
12:10官方账号arXiv cs.AI@Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao
OpenForgeRL 是一个开源框架,用于端到端训练基于推理 harness(如 Claude Code、Codex)的智能体。它通过轻量级代理记录模型调用作为训练数据,并使用 Kubernetes 编排器在远程容器中执行 rollout。在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7。GUI 基准测试中,OSWorld-Verified 得分 37.7,Online-Mind2Web 得分 63.0,WebVoyager 得分 72.3。这些结果超越同规模开源基线,在 GUI 场景中甚至匹配或超越数倍大的模型。
推荐理由:想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
7月23日
7月22日