训练完 RL 模型想追查是哪条数据教会它某个行为?这篇直接证明现有归因方法大多被梯度大小和流畅度这类干扰项骗了,还给了套评测清单。
#GRPO
这篇论文把 RAG 从'检索'升级成'主动算证据',RouterLM 用 Qwen3.5-9B 就打赢了 Gemini 3.5 Flash,做 RAG 的可以看看思路。
一篇有意思的论文:不靠每次采样几十个候选,而是把 power sampling 的锐化直接蒸进模型,单次生成就超过 64 候选采样,数学和代码基准都有实测数字。
Raschka 又更新了,这讲直接用 PyTorch 手写 GRPO,把 Qwen3-0.6B 的数学成绩从 15% 拉到 47%,想搞懂推理模型怎么训的别错过。
Raschka 又出新教程了,这次手把手带你从零写 GRPO,把 DeepSeek-R1 那套推理训练方法完整实现一遍,还带 MATH-500 评测结果。
Meta 把 RL 那套可验证奖励搬进了写作:先让 Kimi-K2.6 自动生成能区分专家和 AI 的评分标准,再用它训练 Qwen3.5-27B,盲评 95% 胜率打赢人类专家文本。
Qwen3.5-4B 只靠写复盘解释做微调,不用奖励模型就在 SWE-bench 上跑赢 GRPO,做智能体训练的可以看看这套 ROFT 流程。
用 Qwen2.5-VL-3B 在 PMC-VQA 上做了严谨对照实验,发现答案准确率涨了,模型可能反而不看图了,做医疗 VLM 微调的都该看看。
AWS 出的实操教程,手把手教你在 HyperPod 上用 SkyRL 给 Qwen3-VL-8B 做 GRPO 多模态训练,最后还能部署 LoRA 推理。
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
腾讯混元把经典批大小理论搬进了 LLM 强化学习,实测 PPO 吞吐提升 2.29 倍、GRPO 训练省 29% 时间,做 RL 训练的可以看看怎么调参省钱。
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
一篇教 RL 生成 SVG 的论文:把每条指令拆成 6 项评分细则当奖励,不需要标注数据,效果追平 DeepSeek-V3,做生成任务奖励设计的可以看看。