11:34官方账号arXiv cs.LG@Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora论文提出Skill Entropy,用于度量模型在同一推理链中切换不同技能(如先做数学推导再规划日程)的难度。基于558个技能和9个可验证领域构建了Skill^2-Bench基准,任务按技能熵分为三个难度等级。在8个前沿模型和4个开源模型上的测试显示,技能熵越高的任务准确率越低,存在明显的技能切换差距。将Skill Entropy作为训练信号,Skill-Entropy RL在Qwen3-4B-Instruct上将Skill^2-Bench得分从34.4%提升到68.4%,在Qwen3-1.7B上从14.6%提升到40.1%。该训练流程还能直接应用到OpenR1-Math等现有数据上。论文Skill EntropySkill^2-BenchQwen3推荐理由:Skill Entropy能测出模型切换推理技能的短板,还能当训练信号:Qwen3小模型得分从34%飙到68%,也能用在OpenR1-Math数据上。原文稍后读已读值得跟进有用关注 Skill Entropy