论文10:16Le Critique:LLM强化学习的特权价值函数这论文提了两个新招PVF和TETHER,给LLM强化学习用的,比标准价值函数强,和GRPO差不多甚至更好,搞RL的可以看看。#LLM#GRPO#强化学习#PVFaarXiv cs.LG@Siddarth Venkatraman 等 3 人原文稍后读已读值得跟进有用关注 LLM