论文12:34参数空间探索新方法3PO:提升LLM强化学习性能想提升LLM强化学习效果?3PO用参数采样替代温度调节,在OLMo和Qwen上比GRPO更稳更好,成本还一样。#3PO#GRPO#参数空间探索#强化学习aarXiv cs.LG@Vatsal Venkatkrishna 等 3 人原文稍后读已读值得跟进有用关注 3PO