这篇用有解析解的金融博弈当考卷,发现 PPO 奖励给对了也学不准,问题出在 critic 排序动作的能力上,对做 RL 金融应用的人很有参考价值。
#PPO
共 16 条 · 7 天 1 条 · 30 天 4 条
信息流里打上「PPO」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月5日
论文20:13
论文:解析解 broker-trader 博弈中 PPO 奖励正确仍学不准9月24日
Tencent Hunyuan 研究批大小扩展理论,PPO 生成吞吐提升至 2.29 倍
腾讯混元把经典批大小理论搬进了 LLM 强化学习,实测 PPO 吞吐提升 2.29 倍、GRPO 训练省 29% 时间,做 RL 训练的可以看看怎么调参省钱。
9月23日
PACT 论文:对齐 critic 与策略,提升 LLM 强化学习训练效果
一篇把 LLM 强化学习里 credit assignment 讲清楚的论文,PACT 训练后在数学推理上比 GRPO 高 8.8 个点,搞 RL 后训练的值得看看推导。
9月22日
9月4日
8月28日
8月18日
8月11日
7月21日
7月14日
7月9日
6月30日
6月18日
6月16日
论文10:36
Proximal Policy Optimization for Amortized Discrete Sampling这篇论文把PPO用到了GFlowNet上,收敛更快、数据效率更高,做离散采样研究的可以看看。
5月29日
ESPO:早期停止PPO,节省20%推理token并提升数学推理性能
做LLM强化学习训练的团队终于有了一个能省算力又提效果的方法——ESPO在数学推理任务上不仅性能更好,还省了20%的token,训练成本敏感的团队值得一试。
5月20日
RL优化LLM代码生成提示词:PPO代理提升Pass@1至85.5%
做LLM代码生成或提示词工程的开发者,这个框架直接解决了提示词敏感性问题——用RL自动优化提示词,比手动调参高效得多,建议关注其混合动作空间和奖励设计。