#强化学习
共 614 条 · 7 天 61 条 · 30 天 202 条 · 话题观测 →
10月5日
论文20:31
EVOL:用知识追踪模拟器生成专家路径,免部署训练学习路径推荐策略一篇把机器人仿真训练搬到教育推荐上的论文,用模拟器造专家数据解决奖励稀疏问题,还对比了三种模仿学习策略,做 LPR 的可以看看。
论文20:13
论文:解析解 broker-trader 博弈中 PPO 奖励正确仍学不准这篇用有解析解的金融博弈当考卷,发现 PPO 奖励给对了也学不准,问题出在 critic 排序动作的能力上,对做 RL 金融应用的人很有参考价值。
研究证明 Success Conditioning 在一类 MDP 上收敛于最优策略
如果你做强化学习,这篇把平时凭感觉用的 success conditioning 给了收敛证明和速率,折扣 MDP 和单期 MDP 分别给了 O 界,理论党可以细看。
Wayfarer:通过拉普拉斯表示学习自动发现选项,攻克 Atari 高难游戏
强化学习老难题——自动发现选项,这篇用拉普拉斯表示在 Atari 最难游戏上拿到单流 SOTA,做 RL 的朋友可以细看。
10月4日
Build A Reasoning Model 第 6 讲:用纯 PyTorch 从零实现 GRPO 训练推理模型
Raschka 又更新了,这讲直接用 PyTorch 手写 GRPO,把 Qwen3-0.6B 的数学成绩从 15% 拉到 47%,想搞懂推理模型怎么训的别错过。
Sebastian Raschka 发布第6期教程:从零实现 RLVR 与 GRPO 训练推理模型
Raschka 又出新教程了,这次手把手带你从零写 GRPO,把 DeepSeek-R1 那套推理训练方法完整实现一遍,还带 MATH-500 评测结果。
10月3日
10月2日
10月1日