论文10:18批量自适应剪枝:周期性神经元激活感知的推理模型压缩法DeepSeek-R1-Distill-Qwen-7B实测:批大小4准确率比旧剪枝高39.7个点,还有1.40倍加速。#DeepSeek-R1-Distill-Qwen-7B#自适应剪枝#推理模型#批推理aarXiv: DeepSeek@Yongmin Kim 等 5 人原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B
论文09:24令牌预算饱和与思维链推理非收敛的早期机制检测这篇论文发现DeepSeek-R1推理非收敛在早期就能从内部表征检测到,未来可做自适应计算分配,研究推理效率的朋友可以看看。#DeepSeek-R1-Distill-Qwen-7B#推理模型#早期检测#令牌预算aarXiv: DeepSeek@Renuka Oladri 等 3 人原文稍后读已读值得跟进有用关注 DeepSeek-R1-Distill-Qwen-7B