09:38官方账号arXiv cs.AI@Peng Xie确定性KV-Cache驱逐保留top-k token,论文证明该方法无法估计被丢弃内容导致的注意力输出误差。随机化驱逐通过泊松采样尾部并应用Hájek校正,在softmax中实现,保留集上的方差估计可作为每步误差证书,经验覆盖率达0.97且无精度损失。在真实工作负载上预注册七个主张,其中三个被否定:问题感知驱逐在25-50%预算下近乎免费;输出对数概率比证书更好预测失败;证书门控预算升级无增益。留存结果为:证书可分离缓存引发与固有失败(AUC 0.73-0.75,输出置信度仅0.47-0.54),并比随机或置信度门控更优地安排重计算。论文KV-Cache驱逐策略误差证书推荐理由:一篇论文证明了随机化KV-Cache驱逐能提供误差证书,覆盖率达97%。如果你关心推理加速中的精度损失量化,这方法很实用。原文稍后读已读值得跟进有用关注 KV-Cache