论文09:44Kalman滤波结合课程学习:自适应RL微调的动态提示选择论文提出KGPS,用卡尔曼滤波动态挑RL微调提示,比DS少用83%的rollout还提分,适合想省算力的人。#KGPS#DeepSeek-R1-Distill-7B#RL微调#提示选择aarXiv: DeepSeek@Haodong Zhu 等 7 人原文稍后读已读值得跟进有用关注 KGPS
论文精选10:46CES框架:动态控制LLM推理熵,平衡准确率与响应长度做LLM推理优化的团队终于有了一个能同时提升准确率和缩短响应长度的方案——CES框架在数学推理任务上效果显著,建议做模型推理效率的开发者点开看看具体实现。#推理模型#熵塑形#响应长度优化#DeepSeek-R1-Distill-7BaarXiv: DeepSeek@Shuyu Wei 等 9 人原文稍后读已读值得跟进有用关注 推理模型