09:44官方一手arXiv: DeepSeek@Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang论文提出KGPS(Kalman-Guided Prompt Selection),将RL微调中的提示选择重构为动态状态估计问题。该方法用线性高斯状态空间模型对每个提示的潜在成功率建模,过程噪声随策略更新幅度增大。Kalman滤波器维护提示难度的后验分布,优先选择中等难度且不确定性高的提示。在数学、规划和几何推理基准上,KGPS在DeepSeek-R1-Distill-7B上比DS方法少用83%的rollout,平均性能提升0.12分。论文KGPSDeepSeek-R1-Distill-7BRL微调推荐理由:论文提出KGPS,用卡尔曼滤波动态挑RL微调提示,比DS少用83%的rollout还提分,适合想省算力的人。原文稍后读已读值得跟进有用关注 KGPS