#强化学习
想让你的 Agent 真刀真枪比一场?BenchFlow 办了场比赛,用免费 GPU 训 Qwen3.8-27B,看谁的环境设计能把模型调到最强。
KingKong 把 1.8 kg 的 22 自由度跳跳机器人 Jumper 整套开源了,从 MuJoCo 强化学习到 RKNN 部署都有,能跳 400 mm,做硬件的朋友可以直接复现。
一篇挺有意思的方法论文:把等价的修复方案归到同一个机制里再去做探索,在2212个代谢模型上把成功率从17.93%提到20.10%,思路值得做科学发现方向的人看看。
有意思的尝试:Jev 不生成文本、一次前向就出答案,论文让它当参考策略、探索裁判和回放评分器,MiniGrid 和 Atari 上都跑赢了标准 RL 学习器。
NVIDIA 发现 RL 每步只改 1% 的权重,于是做了个只传差异的检查点同步方案,1T 模型从 87 分钟降到 150 秒,跑大规模 RL 的团队可以看看。
流策略微调太慢的问题有解了,这篇 SQAM 砍掉了每步的反向传播计算,OGBench 难题成功率提升最多 35 个点,还验证到了真实双臂机器人上。
一篇机器人方向的新论文:给 VLA 模型加了个多样性奖励来做 RL 微调,π_0 分布外成绩提了 5.3 分,真机上成功率也从 64% 涨到 73%。
训练 LLM 做 RL 时长尾 rollout 又慢又掉点?这篇 arXiv 论文的 RollVerify 提前验证修复样本,效率效率、准确率都不丢。
Google 在 COLM 2026 现场演示 EnvHarness,一个给 Agent 环境做动态改造的插件架构,做强化学习的可以看看思路。
微软研究院的这个 Agent Lightning 挺实用,做智能体的朋友不用重写框架,现有的 Agent 直接接上就能跑强化学习训练。
有人把 Claude Code、Codex 这些 harness 全改成了 RL 环境,接 vLLM 就能自己设计奖励,训练后工具调用少了 31%。
一篇教代码智能体"怎么从自己的纠错里学到更多"的论文,在 DeepSeek/CodeARC 上把 Pass@1 从 15.0% 拉到 20.4%,做法挺有意思。
新加坡国立和 collaborators 出的一篇论文,教模型从一堆论文里提炼新研究点子,训练加检索两条路分开验证,做科研 AI 的可以看看思路。
做推荐系统的朋友可以看看这篇:RLCP 让推荐候选集大小随会话动态变化,在 KuaiRand-Pure 和 MovieLens 1M 上多样性最高到基线的 5.21 倍。
做 RL 训练的朋友看下,CoreWeave 这个功能把换检查点的时间砍掉约 15 倍,Nemotron 实测 BrowseComp 涨了 8 个多点。
CADENCE 算法部署守卫时不知道该把智能体放到哪个角落,这篇论文用 CNN 和 GATv2+DQN 学会挑角落,7500 次测试跑得更快、用的智能体更少,形式化保证还一点没丢。
不用 RL 训练,只在开头加个 "Okay" 就能让 Olmo-3-7B 数学成绩翻近一倍,这篇论文把原因挖得很透,做模型训练的值得看看。
一篇讲 agent 记忆管理的论文,用 RL 学出策略在“查现成记忆”和“现整理原始历史”之间动态切换,还能按成本和延迟偏好调,实验跑在五个多模态基准上。
Bengio 在 FT 上发文,把 Hugging Face 和澳洲 Medicare 被黑归到 RL 的奖励机制头上,观点挺扎心。
四足机器人背上没固定的纸箱走坡道台阶,成功率 0.850 比基线 0.675 高不少,做法是多目标 RL 加在线调权,做机器人的可以看看。
arXiv 上这篇挺有意思:想知道 RL 训练后哪些题能解出来,用别的模型训过的 checkpoint 预测,比一堆先验指标都准。
一篇方法论文:搞强化学习或扩散模型的朋友可以看看,SCF 不用重要性采样也能从 critic 给的未归一化密度里采样,训练还更快。
有个叫 flow-1 的新模型专查智能体运行日志里的错误,性能对标 GPT-6-sol 但便宜 23 倍,做 Agent 监控的可以看看。
Hugging Face 把 Claude Code、Codex 这些真实编程工具直接当 RL 训练环境用,不用改一行代码,LFM2.5-2.6B 训练后 OpenCode 成绩从 34% 涨到 58%,全套开源可复现。