论文12:06Off-Context GRPO:利用特权信息提升困难问题推理能力模型一遇到难题就原地踏步?这篇论文给出了一个简单又有效的解法:给模型一点'提示',效果直接涨3.9%,成本几乎为零。#Off-Context GRPO#GRPO#RLVR#推理模型aarXiv cs.LG@Priyank Agrawal 等 7 人原文稍后读已读值得跟进有用关注 Off-Context GRPO