10:25官方账号arXiv cs.AI@Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland经典强化学习追求确定性策略以最大化标量奖励期望,但在语言模型微调或科学发现等现代应用中,多样性至关重要。现有方法如熵正则化或多样性奖励常需脆弱权衡,牺牲性能换取随机性。本文提出将奖励函数视为分布而非标量,通过非线性的动作集目标函数,使校准的行为多样性自然涌现,且不牺牲期望奖励。在上下文赌博机设定下,推导了原则性的梯度估计器,证明该框架泛化了策略梯度与动作集方法。实验表明,该方法为需要行为广度的复杂RL任务提供了稳健的理论替代方案。论文强化学习多样性奖励不确定性推荐理由:做RL研究或语言模型微调的团队,如果正为多样性-性能权衡头疼,这篇论文给出了一个理论干净的新框架——把奖励不确定性当作多样性来源,不用额外调参。值得细读。原文稍后读已读值得跟进有用关注 强化学习
10:17官方账号arXiv cs.AI@Senjie Jin, Peixin Wang, Boyang Liu, Xiaoran Fan, Shuo Li, Zhiheng Xi, Jiazheng Zhang, Yuhao Zhou, Tao Gui, Qi Zhang, Xuanjing Huang精选研究发现,在视觉推理任务中,仅依赖令牌级熵进行强化学习(RLVR)会失效,因为视觉敏感但熵低的令牌被忽略。现有多模态RL方法要么缺乏系统视觉度量,要么忽视熵主要驱动语义探索。为此,研究者提出VEPO框架,通过视觉敏感性与令牌熵的乘法耦合,将梯度信用分配给同时具备视觉基础和高信息量的令牌。实验表明,VEPO在7B和3B规模上分别比熵基线提升2.28和3.15个百分点,消融实验验证了方法的有效性。论文强化学习视觉推理令牌选择推荐理由:视觉推理强化学习一直缺乏有效的信用分配机制,VEPO解决了这个痛点——做多模态RL的团队可以直接参考这个框架,在视觉-语义交叉场景中提升模型表现。原文稍后读已读值得跟进有用关注 强化学习
05:02rohanpaul_ai@rohanpaul_ai88°微软发布了 MAI-Thinking-1,这是其自研推理模型系列的首个成果。该模型采用 1T 总参数的混合专家架构,每次推理仅激活 35B 参数,在 AIME 2025 上达到 97.0%,LiveCodeBench v6 上 87.7%,SWE-Bench Pro 上 52.8%。微软称其训练流程为“爬山机器”,通过持续优化数据、训练、奖励和安全测试形成闭环。预训练基于 30T 主要人工生成 token,避免使用第三方模型蒸馏,随后通过强化学习提升数学、编程、工具使用和安全能力。这标志着微软在推理模型领域建立了完整的自研能力。AI模型推理模型微软MAI-Thinking-1推荐理由:微软用自研数据+强化学习打造了强推理模型,做 AI 推理或模型训练的团队值得关注其“爬山机器”方法论,尤其是 35B 激活参数就能达到接近顶尖水平的效率。原文稍后读已读值得跟进有用关注 推理模型
02:32Harrison Chase@hwchase17验证器对于扩展评估和强化学习至关重要,但成本高昂。Harvey 团队与 LangChain 合作,探索如何降低验证器成本。该研究由 Vtrivedy10、jakebroekhuizen 等人主导,旨在解决验证器在规模化应用中的经济瓶颈。这项工作可能为 AI 评估和 RL 训练提供更经济的方案。AI模型验证器评估强化学习推荐理由:做 AI 评估或强化学习的团队,验证器成本一直是个头疼问题——Harvey 和 LangChain 的这项研究直接给出了降本思路,值得关注。原文稍后读已读值得跟进有用关注 验证器
12:19官方一手arXiv: OpenAI@Hikmet Simsir, Ozgur S. Oguz精选论文提出 Lagrangian Perturbation Diffusion Steering (LP-DS),一种轻量级方法,通过优化冻结生成式策略的噪声空间扰动来提升性能,无需更新大型动作解码器。LP-DS 使用拉格朗日信任域目标,在提升下游价值的同时约束与潜在先验的偏差。在 RoboMimic、OpenAI Gym 和 Adroit 等基准测试中,LP-DS 在样本效率、成功率和回报上均有提升,回报比先前基线提高最多 25%。该方法还适用于流匹配骨干、大型视觉-语言-动作模型,并在真实 Franka 机器人上验证了有效性。论文扩散模型强化学习机器人操控1 个信源在谈事件专题推荐理由:做机器人操控或强化学习的团队,终于有了一个不更新大模型也能微调扩散策略的轻量方案——LP-DS 在保持动作多样性的同时提升回报,建议试试看能否解决你的分布偏移问题。原文稍后读已读值得跟进有用关注 扩散模型
12:06官方一手arXiv: Anthropic@Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew ReimherrReSkill 是一种新型的智能体强化学习框架,旨在解决现有方法中技能创建与策略优化脱节的问题。它受 Anthropic 的 Skill Creator 启发,将技能创建嵌入到策略学习循环中,通过断言驱动的技能创建器、组内采样和自适应 Thompson 采样三个机制,实现技能与策略的协同进化。实验表明,ReSkill 在多个领域优于现有方法,尤其在未见任务上表现突出,能自动创建、测试、优化和淘汰技能。该工作为构建可泛化的智能体系统提供了新思路。论文智能体强化学习技能学习4 个信源在谈事件专题推荐理由:做智能体强化学习的团队终于有了一个能自动积累可复用策略的框架——ReSkill 让技能创建和策略优化不再打架,直接提升泛化能力,做 RL 和 LLM 智能体的研究者值得细读。原文稍后读已读值得跟进有用关注 智能体
12:05官方账号arXiv cs.LG@Ning Lu, Baijiong Lin, Shengcai Liu, Jiahao Wu, Haoze Lv, Yanbin Wei, Lingting Zhu, Shengju Qian, Xin Wang, Ying-Cong Chen, Qi Wang, Ke Tang论文提出 PaW 框架,在强化学习训练语言智能体时,利用策略 rollout 中的动作-观测对作为世界模型监督信号,无需额外模拟器或推理计算。通过动作熵筛选数据、噪声容忍损失和自适应损失平衡三个组件,PaW 在多个智能体任务基准上显著优于纯 RL 基线。该方法解决了 RL 缺乏环境反馈监督的问题,让智能体不仅知道“做什么能得高分”,还理解“动作对环境的影响”。实验表明标准 RL rollout 即可提供有效的世界模型训练信号,降低了世界模型的应用门槛。论文强化学习世界模型语言智能体推荐理由:做语言智能体强化学习的团队,可以用 PaW 在现有 RL 流程中零成本加入世界模型监督,提升智能体对环境的理解能力,值得在项目中尝试。原文稍后读已读值得跟进有用关注 强化学习
12:04官方账号arXiv cs.LG@Lei Yang, Siyu Ding, Deyi Xiong该研究揭示了多域强化学习(RL)中一个关键问题:在数学推理、代码生成等单一领域训练会损害其他领域性能。现有解释(如灾难性遗忘或全局梯度冲突)不完整,因为即使全模型梯度几乎正交时,干扰仍会发生。研究发现,单域RL产生稀疏、小幅度的参数编辑,不同领域共享大量活跃计算路径,更新方向决定协同或冲突。基于局部扰动模型,作者证明后期训练主要通过二阶损伤项损害早期领域,该损伤集中在低维共享冲突子空间。通过短暂领域刷新(如代码→数学→问答→创意写作后重新训练数学),数学性能从57.66恢复至66.04,且其他领域性能保持良好,平均得分达66.39。此外,无训练的回滚方法也部分恢复了数学性能,提供了局部损伤的直接证据。论文强化学习多域训练干扰恢复推荐理由:该理论解释了多域RL训练中性能下降的机制,并提出了有效的恢复方法,对从事LLM后训练和多任务学习的开发者有直接指导意义,建议关注其刷新策略。原文稍后读已读值得跟进有用关注 强化学习
12:04官方账号arXiv cs.AI@Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee推理语言模型在复杂推理任务上表现优异,但在非英语输入上仍存在多语言推理差距,主要原因是语言理解失败。英语翻译可以缓解这一问题,但并非所有输入都需要翻译。为此,研究者提出 Luar(语言理解边界感知强化学习框架),训练模型在直接理解不可靠时选择性调用翻译。在多项多语言推理基准测试中,Luar 优于标准 GRPO 等方法,尤其在低资源语言上提升显著。该框架能避免不必要的翻译,并泛化到未见过的低资源语言。项目代码已开源。论文推理模型多语言强化学习推荐理由:多语言推理场景下,翻译不是越多越好——Luar 教会模型在「不懂的时候才翻」,做多语言 NLP 或低资源语言应用的团队可以直接用这个框架来提升推理效率。原文稍后读已读值得跟进有用关注 推理模型
11:12官方账号arXiv cs.AI@Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao DaiSafeMCP 是一个服务器端防御插件,针对 LLM Agent 使用 MCP 协议时因动作空间扩大带来的安全风险。它通过内部世界模型进行前瞻推理,实现两层防御:主动工具过滤限制危险权限扩展,以及即时干预作为故障安全机制。训练采用三阶段流程:环境动态基础、安全策略初始化和带双重可验证奖励的强化学习。在 PowerSeeking Bench、ToolEmu 和 AgentHarm 上的实验表明,SafeMCP 能在降低风险的同时保持 Agent 的实用性。论文MCP/工具LLM Agent安全防御推荐理由:做 LLM Agent 安全防护的团队终于有了一个可落地的方案——SafeMCP 在服务器端用前瞻推理主动过滤危险工具调用,比事后审计更有效,建议关注其开源实现。原文稍后读已读值得跟进有用关注 MCP/工具
11:09官方账号arXiv cs.AI@Yogesh Kumar Meena, Saurabh Agarwal, K. V. Arya研究人员提出RL-ACRGNet,一种结合预训练DenseNet编码器和多级LSTM解码器的改进编码器-解码器模型,用于自动生成胸部X光报告。该模型在离策略强化学习框架下,通过双网络结构和基于度量的奖励机制优化视觉-语义嵌入,在IU-Xray数据集上BLEU-4、METEOR和ROUGE-L指标分别提升0.47%、0.17%和0.518%,并在MIMIC-CXR数据集上验证了其泛化能力。这项研究旨在解决手动生成放射报告耗时且不一致的问题,推动医学影像AI的自动化诊断流程。论文医学影像强化学习报告生成推荐理由:医学影像团队终于有了更精准的自动报告生成方案——RL-ACRGNet通过强化学习优化视觉语义对齐,做医疗AI的开发者可以直接参考其双网络奖励机制来提升模型临床相关性。原文稍后读已读值得跟进有用关注 医学影像
11:02IT之家(博客/媒体)精选72°图灵奖得主理查德·萨顿指出,普通生成式AI(如大语言模型)缺乏自我评估与持续筛选能力,因此难以完成真正的科学发现。他认为科学发现需要变异、评估和选择性保留三步,而生成式AI只擅长生成变体,缺少测试环节来筛选更好方案。萨顿列举AlphaGo、AlphaFold等系统作为正面案例,这些系统都有评估闭环。他还批评AI行业过度押注更大语言模型,更看好能与环境互动、从经验中学习的AI智能体。行业生成式AI科学发现强化学习推荐理由:萨顿点出了生成式AI在科学发现上的根本局限,做AI研究和科学发现的团队值得反思:你的系统有评估闭环吗?原文稍后读已读值得跟进有用关注 生成式AI
10:01AK@_akhaliq精选GrepSeek 是一种新型搜索智能体训练方法,旨在让 AI 直接与语料库进行交互,而非依赖传统检索管道。它通过强化学习训练模型学会自主搜索、定位和提取信息,显著提升在复杂查询中的准确性和效率。该方法解决了现有搜索系统在长尾、多步推理任务中的局限性,为信息检索和问答系统提供了新范式。实验表明,GrepSeek 在多个基准测试上优于传统检索增强生成(RAG)方法。论文搜索智能体强化学习语料库交互推荐理由:做搜索或问答系统的开发者值得关注——GrepSeek 让 AI 学会自己翻语料库,比 RAG 更灵活,建议看看它怎么绕过传统检索瓶颈。原文稍后读已读值得跟进有用关注 搜索智能体
09:42官方账号arXiv cs.AI@Yujiao Chen该研究在马尔可夫决策过程(MDP)中引入吸收灾难态,发现即使风险中性且无效用曲率,标准Bellman最优性仍会产生前景理论三大特征:S型价值函数(近灾难凸、远场凹)、内生损失厌恶系数λ*>1、以及反射效应策略反转。在495种配置下,正漂移(增长)场景中靠近灾难态时最优策略选择安全动作,负漂移(衰退)场景中则选择冒险动作。研究推导出渐近损失厌恶平台λ的闭式表达式,仅依赖胜率p、收益不对称比r和折扣因子β,与数值解拟合R²=0.999。该机制无需不对称收益,且现象在表格Q学习和随机转移下稳健存在。论文强化学习前景理论灾难态推荐理由:这篇论文揭示了灾难态本身就能产生前景理论行为,对做强化学习安全控制、风险决策建模的研究者很有启发,建议读一下推导和实验设计。原文稍后读已读值得跟进有用关注 强化学习
10:48官方账号arXiv cs.AI@Zaid Khan, Justin Chih-Yao Chen, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal精选该论文研究如何利用大语言模型(LLM)作为 GPU 内核性能的预测器,以替代昂贵的实际硬件测量。在深度学习内核优化中,每次评估都需要编译和多次执行,成本高昂,而 LLM 驱动的搜索扩展后,设备端评估成为瓶颈。作者提出 LLM 应具备准确性和选择性——知道何时可能出错并转交 GPU。实验表明,LLM 能准确预测相对性能,通过强化学习可提升精度和置信度校准。在内核搜索中,替代模型在相同 GPU 预算下可评估数倍候选,从而找到更快的内核。这表明 LLM 可充当 GPU 的虚拟模型,而不仅是内核生成器。论文LLMGPU 内核优化性能预测推荐理由:这篇论文解决了 GPU 内核优化中评估成本高的痛点,做高性能计算或深度学习框架优化的开发者可以直接参考其方法——用 LLM 替代部分硬件测量,在相同预算下找到更优内核。原文稍后读已读值得跟进有用关注 LLM
10:23官方账号arXiv cs.LG@Zhikun Xu, Yu Feng, Jacob Dineen, Taiwei Shi, Jieyu Zhao, Ben ZhouReuseRL 是一种基于最小描述长度(MDL)原则的强化学习方法,旨在解决大语言模型智能体在强化学习中学习到脆弱、任务特定捷径的问题。该方法从成功轨迹中提取可复用的抽象技能字典,并通过分割成本惩罚编码效率低下的行为,从而鼓励智能体学习更通用、可压缩的行为模式。论文证明了该压缩惩罚的 PAC-Bayes 泛化界,并在 ALFWorld、TextWorld-Cooking 和 Countdown-Stepwise 等基准上,ReuseRL 在分布内和分布外任务上均优于 vanilla GRPO 和强基线方法。这项工作为提升智能体泛化能力提供了新思路,尤其适合需要跨任务迁移的 RL 场景。论文强化学习智能体技能复用推荐理由:ReuseRL 用 MDL 原则解决了智能体 RL 泛化差的痛点,做多任务智能体训练的团队可以直接参考其技能复用机制,提升模型在未见任务上的表现。原文稍后读已读值得跟进有用关注 强化学习
10:11官方账号arXiv cs.LG@Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li精选LongTraceRL 是一种新方法,旨在解决大语言模型在长上下文推理中难以定位和整合关键信息的问题。它通过知识图谱随机游走生成多跳问题,并利用搜索智能体的轨迹构建高混淆度的干扰文档,使训练上下文更具挑战性。同时,它提出了一种基于实体级过程监督的“评分奖励”,只对正确答案的推理过程进行细粒度评估,避免奖励作弊。在 4B 到 30B 的多个推理模型上,LongTraceRL 在五个长上下文基准测试中持续优于强基线,并促进了基于证据的推理。代码、数据集和模型已开源。论文长上下文推理强化学习搜索智能体推荐理由:长上下文推理是当前大模型的瓶颈,LongTraceRL 用搜索轨迹和细粒度奖励解决了干扰项和奖励稀疏的问题,做推理模型训练或长文档理解的团队可以直接用开源代码复现。原文稍后读已读值得跟进有用关注 长上下文推理
10:19官方一手marktechpost@Michal Sutter精选72°Trajectory 与 UC Berkeley Sky Lab 和 Anyscale 合作,构建了一个用于持续学习的并发多 LoRA 训练栈。该方案将每个强化学习实验映射到始终热运行的引擎上的专用 LoRA 适配器,相比单租户基线实现了 2.81 倍的端到端实验吞吐量提升,且无奖励回归。代码已在 NovaSky-AI/SkyRL 开源。这一进展解决了持续学习中多实验并行效率低下的问题,对强化学习研究和工程团队有直接价值。AI模型LoRA持续学习强化学习推荐理由:做强化学习持续训练的团队终于有了高效的并行方案——2.81 倍吞吐量提升且不损失奖励,直接开源可用,建议试试。原文稍后读已读值得跟进有用关注 LoRA
16:47Stanford AI Lab@StanfordAILab精选斯坦福SAIL与ETH合作研究表明,在极难任务中,使用丰富反馈的强化学习(RL)显著优于传统标量奖励方法。该研究通过对比实验,验证了多维度反馈信号能更有效地引导智能体学习复杂策略。这一发现对AI训练范式有重要启示,尤其适用于需要精细控制的机器人、游戏AI等领域。研究团队已公开部分代码和实验细节,供社区复现和进一步探索。论文强化学习反馈机制斯坦福SAIL推荐理由:这项研究为强化学习训练提供了新思路,做RL或机器人控制的开发者值得关注——丰富反馈可能成为突破复杂任务瓶颈的关键。原文稍后读已读值得跟进有用关注 强化学习
16:45Stanford AI Lab@StanfordAILab斯坦福人工智能实验室(SAIL)发布博客文章,介绍其最新研究VAGEN。VAGEN是一个强化学习框架,旨在训练视觉语言模型(VLM)智能体通过明确的视觉状态推理来构建内部世界模型。该框架使智能体能够更好地理解环境动态,从而在复杂任务中做出更合理的决策。这一进展对于提升AI在机器人、自动驾驶等需要环境理解的领域中的表现具有重要意义。论文强化学习VLM智能体世界模型推荐理由:VAGEN解决了VLM智能体在复杂环境中缺乏内部世界模型的问题,做机器人或自动驾驶研究的团队值得关注,它可能让AI的决策更接近人类推理。原文稍后读已读值得跟进有用关注 强化学习
13:01官方一手arXiv: DeepSeek@Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu, Zeming Li, Binhua Li, Yongbin Li, Tong Yang, Jieping Ye72°ESPO(Early-Stopping Proximal Policy Optimization)是一种针对大语言模型强化学习训练的新方法,能在推理轨迹中早期检测到错误步骤并提前终止生成。传统PPO算法在模型犯错后仍会强制生成直到最大步长,浪费计算资源并污染优势估计。ESPO通过实时计算基于logits的代理遗憾值,在累积遗憾显著超过估计值时终止轨迹,并将截断轨迹视为吸收失败状态,无需额外奖励模型或人工标注。在DeepSeek-R1-Distill-Qwen-7B的数学推理训练中,ESPO在AIME 2024、AMC 2023和MATH-500上均超越PPO,同时累计节省超过20%的生成token。论文强化学习PPO数学推理推荐理由:做LLM强化学习训练的团队终于有了一个能省算力又提效果的方法——ESPO在数学推理任务上不仅性能更好,还省了20%的token,训练成本敏感的团队值得一试。原文稍后读已读值得跟进有用关注 强化学习
11:08官方账号arXiv cs.AI@Chen Henry Wu, Aditi Raghunathan精选83°论文提出自训练验证(STV)方法,解决推理模型在测试时验证-精炼循环和训练时自训练中验证器失效的瓶颈。核心发现是模型单独无法捕捉自身错误,但看到参考答案后可以,利用这一不对称性训练验证器模仿更知情版本。STV在困难数学题上准确率翻倍,科学推理任务从1.5%提升至21%。结合验证器在循环中的强化学习(ViL),使pass@1再提升33%,且生成器独立推理能力也超越标准RL收敛点。这表明推理模型的下一个前沿在于如何训练验证及利用验证。论文推理模型自训练验证测试时改进推荐理由:推理模型开发者长期受困于验证器失效导致自改进停滞,STV用参考答案不对称性巧妙破解,在困难数学和科学任务上效果显著,做自训练或测试时搜索的团队值得深入看。原文稍后读已读值得跟进有用关注 推理模型
10:24官方账号Clement Delangue@ClementDelangue精选72°Hugging Face CEO Clément Delangue指出,当前大多数人在用强化学习训练智能体LLM时,存在一个静默的bug:单轮RL表现完美,但加入工具调用后,损失函数会无故飙升,最终出现形状不匹配错误。根本原因在于,每次解析模型输出以检测工具调用时,重新对更新后的对话进行token化,可能导致梯度落在模型从未实际采样的序列上,从而产生无用的梯度信号。修复方法很简单:永远不要重新编码已经解码的token,将采样的token保存在一个缓冲区中,避免重新渲染。团队已发布深度分析,包括对主流开源模型家族的审计,显示大多数聊天模板已支持该修复。论文强化学习智能体Token编码推荐理由:做多轮RL训练智能体LLM的团队,这个静默bug可能正在破坏你的训练曲线,看完这篇分析能直接修复,省下大量调试时间。原文稍后读已读值得跟进有用关注 强化学习
23:48AK@_akhaliq该研究提出了一种名为 Agent Explorative Policy Optimization (AEPO) 的新方法,用于优化多模态智能体的推理策略。通过探索性策略优化,智能体能够在复杂多模态环境中更有效地进行推理和决策。实验表明,AEPO 在多个基准测试上显著提升了智能体的性能,尤其是在需要多步推理和跨模态理解的任务中。这项工作为构建更强大的多模态智能体提供了新的训练范式。论文智能体多模态推理模型推荐理由:多模态智能体推理是当前 AI 的前沿方向,AEPO 为开发者提供了一种可落地的训练优化思路,做智能体或多模态应用的团队值得关注。原文稍后读已读值得跟进有用关注 智能体
22:05官方账号Clement Delangue@ClementDelangue精选83°Hugging Face 科学团队在 TRL 库中实现了一种新的异步强化学习权重同步方法,将每次同步的带宽成本降低约 100 倍。核心洞察是:在 RL 步骤之间,约 99% 的 bf16 权重是比特相同的,只有极少部分发生变化。他们只将变化的元素编码为稀疏 safetensors 文件,通过 Hugging Face Bucket 传输,而不是传输整个权重文件。以 Qwen3-0.6B 为例,每次步骤的传输量从 1.2 GB 降至 20-35 MB。这意味着不再需要共享集群、RDMA、VPN 或跨云 NCCL,只需一个 GPU 和一个 Hugging Face 账号即可进行真正的分离式 RL 训练。AI产品强化学习权重同步Hugging Face推荐理由:做分布式 RL 训练的团队终于可以告别昂贵的带宽和复杂的基础设施——只需 HTTPS 和一个 Bucket,就能实现跨区域的推理集群同步,建议搞 RL 的开发者直接看原文。原文稍后读已读值得跟进有用关注 强化学习
15:39官方一手pandaily@contact@pandaily.com (Pandaily)精选76°Sphere AI Lab 开源了 Orbit,一个强化学习后训练框架,支持在单个 8×B200 节点上对万亿参数模型(如 DeepSeek-V4)进行微调。该框架通过优化内存和计算效率,大幅降低了大规模模型训练的门槛,使得资源有限的团队也能进行高效的后训练。Orbit 的发布解决了万亿参数模型训练需要大规模集群的痛点,有望推动更多研究者和开发者参与大模型的后训练优化。AI模型开源/仓库强化学习后训练推荐理由:Orbit 让万亿参数模型的后训练不再依赖大规模集群,做 RL 微调或大模型优化的团队可以直接在单节点上跑 DeepSeek-V4,建议试试这个开源方案。原文稍后读已读值得跟进有用关注 开源/仓库
11:27官方账号arXiv cs.AI@Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang精选多模态大模型的视觉输出需要可靠且细粒度的验证。本文提出多模态元验证方法,发现符号化验证器输出(如边界框)比文本解释更有效,且将二元判断与元验证的强化学习目标解耦能显著提升性能。基于此训练的OmniVerifier-M1通用视觉验证器,不仅提供稳健验证和细粒度错误定位,还驱动了M1-TTS智能体生成系统,实现动态区域级自我修正。该工作为更可靠、可解释的多模态验证铺平道路,支持更安全可控的基础模型部署。论文多模态模型元验证强化学习推荐理由:做多模态模型评估或安全部署的团队,可以关注这种符号化元验证思路——它用边界框替代文本解释做奖励信号,既高效又避免依赖辅助模型,直接提升验证的细粒度与可解释性。原文稍后读已读值得跟进有用关注 多模态模型
10:34IT之家(博客/媒体)精选76°英伟达研究团队发布开源框架 Polar,通过在不改动现有智能体框架(如 Codex、Claude Code、Qwen Code)的前提下接入 GRPO 强化学习训练,大幅提升代码智能体在 SWE-Bench 上的表现。Polar 将智能体与模型的接口作为训练边界,而非重写执行框架,从而保留原生工具调用和上下文组织能力。实验显示,基于 Qwen3.5-4B 模型,Codex 的 pass@1 分数从 3.8% 提升至 26.4%,涨幅达 594.74%。同时,Polar 通过 prefix_merging 等技术将训练效率提升约 5.39 倍,GPU 利用率从 20.4% 升至 87.7%。该框架解决了智能体强化学习从单步任务转向长流程任务时的接入难题,为代码仓库修改、浏览器操作等复杂场景提供了高效训练方案。AI产品英伟达PolarGRPO1 个信源在谈事件专题推荐理由:做代码智能体训练的团队终于有了一个不用重写框架就能接入强化学习的方案——Polar 让 Codex 跑分暴涨近 6 倍,建议搞 AI 编程的开发者直接看论文和代码。原文稍后读已读值得跟进有用关注 英伟达
01:12官方一手marktechpost@Asif Razzaq76°NVIDIA 研究人员推出 Polar,一个 token 忠实展开框架,用于通过强化学习训练语言智能体,无需修改其智能体框架。Polar 在框架和推理服务器之间放置模型 API 代理,捕获 token 级交互并重建训练器就绪轨迹。基于 Qwen3.5-4B 基础模型使用 GRPO,Polar 在 Codex 框架下将 SWE-Bench Verified pass@1 提升 22.6 个百分点,在 Claude Code 下提升 4.8 个百分点,在 Pi 下提升 6.2 个百分点。该框架已注册为 NeMo Gym 环境,并在 ProRL Agent Server 仓库中发布。AI模型NVIDIAPolarGRPO4 个信源在谈事件专题推荐理由:Polar 解决了 RL 训练智能体时需修改框架的痛点,做代码智能体或 RL 训练的开发者可以直接集成,无需改动现有工具链,值得一试。原文稍后读已读值得跟进有用关注 NVIDIA
21:23IT之家(博客/媒体)精选波士顿动力Atlas人形机器人通过观看世界杯历史视频学习足球动作,并进行复刻训练。机器人已完成搬运45公斤冰箱等重物技能,计划亮相2026世界杯。训练基于强化学习,在仿真环境中累计数百万小时。机器人动作从预设编程转向自适应工业作业模式。AI产品Atlas波士顿动力人形机器人推荐理由:Atlas学踢球,拟亮相世界杯原文稍后读已读值得跟进有用关注 Atlas
20:19berryxia@berryxiaMiniMax 在沉寂半年后,将去年 12 月开源的 M2 模型背后的设计思路、训练细节和系统架构整理成论文发布到 arXiv。社区已广泛采用其核心系统如 CISPO、Forge RL System 和 Self-Evolution。MiniMax 表示 M3 模型和 MSA 论文即将发布,此举旨在推动开源生态从单纯卷参数转向公开方法论。AI模型开源/仓库强化学习MiniMax推荐理由:MiniMax 把 M2 的完整训练路径摊开,做开源模型训练或强化学习的团队可以直接参考,少走半年弯路。M3 即将到来,值得关注其系统级突破。原文稍后读已读值得跟进有用关注 开源/仓库
12:14官方一手arXiv: DeepSeek@Mingyue Wang, Xingyu Xie, Hang Yang, Li Gao, Lixin Su, Ge Chen, Dawei Yin, Daiting Shi精选百度搜索团队提出QDET(查询驱动事件时间线摘要)系统,用于在搜索中为热点新闻查询构建聚焦的事件时间线。该系统通过多任务监督微调(时序排序、因果判断、时间线补全)和基于强化学习的简洁摘要生成,使7B参数模型在时间线摘要F1得分(76.2%)上超越DeepSeek-R1-671B(76.1%),参数量仅为后者的1%。在线A/B测试显示,QDET使点击率提升5.5%、停留时间延长4.6%、探索深度增加4.4%。该工作证明领域专用优化能以极低成本达到大模型级别的生产质量。论文事件时间线摘要搜索多任务微调推荐理由:搜索和新闻聚合团队终于有了可落地的轻量级时间线方案——7B模型干翻671B,CTR和用户停留时间双双提升,做搜索排序或事件摘要的工程师可以直接参考其多任务微调策略。原文稍后读已读值得跟进有用关注 事件时间线摘要
10:51官方账号arXiv cs.LG@Shijin Gong, Erhan Xu, Kai Ye, Francesco Quinzan, Giulia Livieri, Chengchun Shi精选BASIS 是一种无需评论家的后训练算法,通过单次采样每个提示的轨迹,并利用整个批次中跨提示的信息共享来改进价值函数估计。实验表明,与单次采样的 REINFORCE++ 基线相比,BASIS 将价值函数估计的均方误差降低了 69%,且单次采样的 MSE 低于 8 次采样的组均值估计器。这种改进带来了更好的策略优化:BASIS 用更少的训练时间达到了接近多采样 GRPO 型基线的性能,并常优于单采样 REINFORCE 型基线。该工作解决了强化学习在计算效率与样本效率之间的权衡问题。论文强化学习推理模型LLM训练推荐理由:做LLM推理强化学习的团队终于有了一个兼顾计算和样本效率的方案——BASIS用单次采样就达到多采样的效果,训练成本大幅降低,建议做RLHF或推理优化的开发者点开看看。原文稍后读已读值得跟进有用关注 强化学习
10:30官方账号arXiv cs.AI@Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang精选论文提出SAERL框架,利用稀疏自编码器(SAE)提取模型内部信号,用于强化学习(RL)后训练的数据工程。SAERL建模了数据的多样性、难度和质量三个内在属性,分别实现批次多样性控制、易到难课程排序和数据过滤。在Qwen2.5-Math-1.5B上,SAERL相比原始GRPO平均准确率提升3%,训练步数减少20%,且在不同模型规模和RL算法上表现一致。实验表明SAE可跨模型族和规模迁移,是一种轻量可复用的数据工程工具。论文稀疏自编码器数据工程强化学习推荐理由:做LLM后训练数据工程的团队终于有了从模型内部获取信号的方法——SAERL用SAE直接指导数据排序和过滤,比依赖外部信号更高效,做RL训练优化的开发者值得一试。原文稍后读已读值得跟进有用关注 稀疏自编码器
23:01rohanpaul_ai@rohanpaul_ai76°Meta、CMU 等机构发表新论文,提出 Self-Play SWE-RL 方法,让编码智能体通过自我制造和修复真实项目中的 bug 来训练自己,不再依赖人类编写的任务数据。该方法将学习单元从标注任务转变为可执行场景:一个模型版本在真实代码库中弱化测试、注入有意义的 bug 并留下测试工件,另一个版本则通过恢复测试行为来修复系统。在 SWE-bench Verified 上取得 +10.4 分、SWE-bench Pro 上 +7.8 分的提升,且评估仍使用自然语言问题,表明模型学到了比问题措辞更深层的东西。论文指出,编码智能体的下一个瓶颈可能不再是更多人类编写的任务,而是让智能体遭遇、创造、承受并从失败中学习的更多方式。论文编码智能体自我对弈强化学习推荐理由:Self-Play SWE-RL 解决了编码智能体依赖人类标注数据的瓶颈,做 AI 编程助手或智能体训练的团队值得关注——它展示了智能体自我进化的新路径,看完会对训练数据来源有全新认识。原文稍后读已读值得跟进有用关注 编码智能体
16:35官方一手marktechpost@Sana Hassan本文是一篇技术教程,详细介绍了如何使用 TuringEnterprises/Open-MM-RL 数据集构建完整的多模态强化学习与可验证奖励(RLVR)管线。教程涵盖数据集加载、模式检查、领域分析、问题长度与答案类型统计、图像分布可视化等预处理步骤。还构建了轻量级奖励函数,支持精确匹配与语义评分,并演示了 GRPO 导出流程。该管线为多模态推理任务提供了可复现的实践框架,适合研究者和开发者快速上手。论文多模态强化学习RLVR推荐理由:多模态 RLVR 是当前强化学习与视觉语言结合的热点方向,这篇教程从数据集到奖励函数再到导出一步到位,做多模态推理或 RL 研究的团队可以直接照着搭,省去自己踩坑的时间。原文稍后读已读值得跟进有用关注 多模态
12:38官方一手arXiv: DeepSeek@Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov, Mrinmaya Sachan, Bernhard Schölkopf, Ryan Cotterell精选研究者将自然语言推理建模为搜索问题,利用 A* 搜索算法指导 LLM 生成正确且高效的推理步骤。通过监督微调(基于 A* 执行轨迹)和强化学习(结合 A* 过程奖励模型),Llama-3.2 1B-3B 模型从近乎零准确率提升至超越 DeepSeek-V3.2。研究发现,简单正确性奖励最大化准确率,而 A* 信号能平衡准确率与效率。在更大搜索空间下,基于不完美启发式的训练反而带来更优准确率。这项工作展示了经典搜索算法指导 LLM 推理的潜力。论文推理模型A* 搜索后训练推荐理由:A* 搜索让小模型推理能力大幅跃升,做推理优化或小模型部署的团队值得关注,可以直接参考其训练方法。原文稍后读已读值得跟进有用关注 推理模型
12:36官方一手arXiv: DeepSeek@Rongsheng Zhang, Ruofan Hu, Weijie Chen, Jiji Tang, Junnan Ren, Wanying Wu, Xunuoyan Chen, Tangjie Lv, Tao Jin, Zhou Zhao精选现有角色扮演智能体在长期对话中因上下文窗口限制而依赖外部记忆,但传统记忆框架仅记录事实,缺乏角色个性解读,导致回复泛化、角色一致性差。为此,研究者提出 RoleMemo 数据集,包含四个推理任务,要求智能体通过角色视角解读事实片段。同时提出 DualMem 框架,将记忆解耦为事实认知和角色条件洞察两个流,通过监督微调和强化学习训练。4B 参数的 DualMem 模型在角色一致性上超越了基于 DeepSeek-V3.2 的零样本框架。相关资源已在 GitHub 开源。论文角色扮演智能体记忆框架推理任务推荐理由:角色扮演智能体长期对话中的记忆与个性保持是行业难题,DualMem 的分离式记忆设计为开发者提供了可落地的解决方案,做虚拟角色或对话系统的团队值得关注。原文稍后读已读值得跟进有用关注 角色扮演智能体
12:22官方账号arXiv cs.LG@Zhaoyu Zhu, Rui Gao, Shuang Li精选该论文首次为Wasserstein策略梯度(WPG)方法在熵正则化强化学习中的全局收敛性提供了严格理论证明。WPG利用动作分布的最优传输几何,通过软Q函数的动作梯度与Langevin扩散更新策略,但标准Langevin分析因RL目标通过Bellman递归依赖策略而失效。研究者通过Bellman残差的KL表示、Bellman收缩与Bellman预解恒等式,建立了分布Polyak-Łojasiewicz条件,并利用对数Sobolev不等式控制离散化误差,最终证明WPG以几何速率收敛至全局最优(存在离散化偏差)。该工作揭示了熵正则化RL虽非传统凸优化,但Bellman递归诱导了有利的PL几何结构。论文强化学习Wasserstein策略梯度全局收敛推荐理由:做连续控制RL的理论研究者会感兴趣——这篇论文用Bellman结构替代凸性假设,为WPG的全局收敛提供了首个完整证明,建议做策略梯度理论的团队仔细读。原文稍后读已读值得跟进有用关注 强化学习
11:43官方账号arXiv cs.AI@Dingbang Wu, Rui Hao, Haiyang Wang, Shuzhe Wu, Han Xiao, Zhenghong Li, Bojiang Zhou, Zheng Ju, Zichen Liu, Lue Fan, Zhaoxiang Zhang精选72°MobileGym 是一个轻量级、浏览器托管的移动GUI仿真环境,通过结构化JSON状态实现确定性结果验证,并支持低成本并行rollout,使在线强化学习在移动应用场景中变得可行。该平台单服务器可运行数百个并行实例,每个实例仅需约400MB内存和3秒冷启动,并提供了416个参数化任务模板(256测试+160训练),覆盖28个应用。在Sim-to-Real案例中,使用GRPO在Qwen3-VL-4B-Instruct上训练,测试集准确率提升12.8个百分点,且真实设备执行保留了95.1%的仿真训练收益。MobileGym 解决了移动GUI Agent研究中环境保真度、可扩展性和评估一致性的核心痛点。论文移动GUI Agent仿真平台强化学习推荐理由:做移动端GUI Agent或强化学习的团队终于有了一个可验证、高并发的仿真平台,不用再依赖私有后端或模糊匹配评估,建议直接看项目页和论文。原文稍后读已读值得跟进有用关注 移动GUI Agent