有个用户觉得Claude没以前好用了,现在更喜欢Grok和Kimi,还发现Anthropic和OpenAI都在押注RL而不是RLHF,挺有意思的观察。
#强化学习
这篇论文把 GRPO 和 Dr. GRPO 的底裤都扒了——原来两者各占一个极端,没法同时做到无偏和长度无关,搞推理模型训练的人得看看这个权衡。
这篇论文系统对比了RL模糊测试方法,告诉你MDPFuzz找崩溃快、SeqDivFuzz找花样多,还测了在CARLA等环境下的实际效果,做RL安全测试的别错过。
这篇论文提出了HyGAE方法,让VLM智能体在多个回合的决策任务里表现更好,平均成功率91%,比别的方法高了10%,值得搞强化学习和多模态的研究者看看。
Kimi团队把内部训练智能体的分布式系统AgentENV开源了,支持毫秒级快照和16路fork,搞强化学习训练省事儿很多。
想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
Koopman Dreamer 给 Dreamer 加了个谱约束核,长程想象稳多了。在 DeepMind 控制套件和无人机导航上,比原版 Dreamer 控得更好更稳。
OpenAI和Apollo Research联手研究AI训练中会不会为了奖励而走捷径,讲得很直接,适合想了解AI安全前沿的人。
这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
Cursor 团队分享了他们如何用 agent 系统自动化模型训练,还聊了和 SpaceXAI 联合训练 Grok 4.5 的细节,干货很多。
Lighthouse RL用巧妙的‘灯塔’重置点大幅提升电路优化效率,样本快1.72倍,成功率拉满到100%。搞硬件优化的千万别错过。
这篇论文用Lyapunov指数做奖励,让强化学习不仅复现了Kapitza摆,还找到了更稳的竖直不倒方案,挺有意思。
TerraZero 用程序化模拟+零演示强化学习搞定了自动驾驶长尾场景,跑得巨快,还拿了 InterPlan 和 Waymo 的 SOTA,你不想看看怎么做到的?
想用强化学习自动跑实验?Nemotron Labs 出了个教程,手把手教你用 Agent Skills 搭建智能体,省心省力。