12:34官方账号arXiv cs.LG@Vatsal Venkatkrishna, Nico Daheim, Iryna GurevycharXiv新论文提出参数空间探索方法3PO(Perturbed Parameter Policy Optimization),通过从后验分布采样不同策略生成rollout,补充传统动作空间探索的不足。在OLMo-3-1025-7B和Qwen2.5-Math-7B上,3PO在数学推理和代码生成任务中平均性能优于标准GRPO,且FLOPs成本几乎相同。多参数采样还减少了训练中零优势组和错误rollout的数量。论文3POGRPO参数空间探索推荐理由:想提升LLM强化学习效果?3PO用参数采样替代温度调节,在OLMo和Qwen上比GRPO更稳更好,成本还一样。原文稍后读已读值得跟进有用关注 3PO