论文精选10:26PAEC:位置感知熵校准提升LLM推理RLVR效果做LLM推理强化学习的团队终于有了更精细的熵控制方案——PAEC在数学推理任务上直接提升多数投票性能,做RLVR的开发者值得关注这个位置感知的新思路。#强化学习#推理模型#熵校准#数学推理aarXiv cs.AI@Shumeng Yang 等 5 人原文稍后读已读值得跟进有用关注 强化学习