论文10:54STARE: 基于惊讶度引导的令牌级优势重加权策略熵稳定性方法STARE解决了GRPO训练中策略熵崩溃的老问题,在AIME数学竞赛上比DAPO高4-8个点,代码也开源了,搞RL训练的同学可以试试。#STARE#GRPO#策略熵#强化学习aarXiv cs.LG@Haipeng Luo 等 7 人原文稍后读已读值得跟进有用关注 STARE