09:44官方一手arXiv: DeepSeek@Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang论文提出KGPS(Kalman-Guided Prompt Selection),将RL微调中的提示选择重构为动态状态估计问题。该方法用线性高斯状态空间模型对每个提示的潜在成功率建模,过程噪声随策略更新幅度增大。Kalman滤波器维护提示难度的后验分布,优先选择中等难度且不确定性高的提示。在数学、规划和几何推理基准上,KGPS在DeepSeek-R1-Distill-7B上比DS方法少用83%的rollout,平均性能提升0.12分。论文KGPSDeepSeek-R1-Distill-7BRL微调推荐理由:论文提出KGPS,用卡尔曼滤波动态挑RL微调提示,比DS少用83%的rollout还提分,适合想省算力的人。原文稍后读已读值得跟进有用关注 KGPS
10:46官方一手arXiv: DeepSeek@Shuyu Wei, Jian Sun, Delai Qiu, Yining Wang, Shengping Liu, Jiaen Liang, Ying Fu, Wei Huang, Jitao Sang精选针对大语言模型推理中响应长度与准确率的权衡问题,研究者提出条件熵塑形(CES)框架。CES基于DAPO,利用token级熵作为不确定性信号,对正确推理路径的高熵“分叉点”进行惩罚以提升简洁性,对错误路径的高熵点给予奖励以鼓励探索。在DeepSeek-R1-Distill-7B上测试12个数学基准,CES在保持或提升准确率的同时显著缩短响应长度,在1.5B小模型和域外基准上也有类似效果。该方法为自适应推理提供了新思路,尤其适合需要高效准确推理的场景。论文推理模型熵塑形响应长度优化推荐理由:做LLM推理优化的团队终于有了一个能同时提升准确率和缩短响应长度的方案——CES框架在数学推理任务上效果显著,建议做模型推理效率的开发者点开看看具体实现。原文稍后读已读值得跟进有用关注 推理模型