论文精选09:12N-GRPO:嵌入级邻居混合增强策略优化N-GRPO 解决了 GRPO 框架中探索与语义保持的冲突,做强化学习或数学推理优化的研究者可以直接参考其嵌入混合策略。#N-GRPO#GRPO#数学推理#嵌入混合aarXiv: DeepSeek@Xukun Zhu 等 4 人原文稍后读已读值得跟进有用关注 N-GRPO