11:56官方账号arXiv cs.LG@Taekyung Heo, Rasoul Shafipour, Ritchie Zhao, Maximilian Golub, Mohammad Mahdi Kamani, Ritika Borkar, Makesh Tarun Chandran, Pantea Zardoshti, Bita Darvish Rouhani论文提出跨模型KV缓存迁移,让同系列不同尺寸模型切换时直接复用源模型的KV缓存,省去接收方从头预填充。在Qwen3 14B到32B上,单个源层能解释目标键56%的方差、值的32%,多个源层提升到79%和65%。方法用闭式岭回归映射器,基于500条FineWeb-Edu序列(每条1024 token)拟合,并在映射前剥离RoPE以保持位置无关。在三个模型族的六对组合中,四对保留了73%到98%的独立预填充准确率,两对退化严重,用非线性MLP最多挽回37个百分点HellaSwag;映射器比重新预填充快2.7到25倍。论文Qwen3KV缓存跨模型迁移推荐理由:同系列模型切换总得重新预填充?这篇用线性映射传KV缓存,能省2.7到25倍时间,四对组合还保住九成以上准确率。原文稍后读已读值得跟进有用关注 Qwen3