论文12:19DepthWeave-KV: 面向长上下文的KV缓存压缩方法长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。#DepthWeave-KV#KV缓存压缩#长上下文#推理加速aarXiv cs.AI@Anna Cordoba 等 7 人原文稍后读已读值得跟进有用关注 DepthWeave-KV