#KV缓存
DeepSeek 把智能体的 KV 缓存砍到每 token 890 字节,比 V1 小 437 倍,Flash 还在 AA Index 上反超 V4-Pro,价格只要一半不到。
研究者测了五个开源模型,发现 Mistral 7B 和 Muse Glimmer 能从已滑出窗口的缓存里找回信息,做长上下文推理的可以看看。
vLLM 和 LMCache 里能直接用的 KV 缓存调度优化,快速层容量从 100 GiB 砍到 25 GiB 吞吐基本不掉,还把 p95 首 token 时间降了 48%。
小米 LLM-Core 团队搞了个 HySparse2 稀疏注意力,1M token 预填充计算量降约 5 倍,做长上下文的可以看看。
arXiv 上一篇讲 KV 缓存的新论文,用本地历史替换当前 token 分支,126M 模型上困惑度降了约 1.4%,做推理优化的人可以看看。
小米把 1M 长上下文的预填充成本砍掉 5 倍,KV 缓存也小了 4.5 倍,跑智能体任务的人可以看看这套 HySparse 2 架构。
DeepSeek 新出的 V4.1-Flash 模型,KV 缓存占用比之前版本小很多,适合做长上下文对话,比如百万级文本的对话,而且性能还更好。
想给RAG省算力又不想掉精度?CoinRAG把检索结果拆成小碎块做缓存复用,LongBench上F1平均提了5.3%,值得一看。
看完这篇论文,你就明白怎么让 LLM 在有多层记忆时不再反复重算——InferScale 直接把 KV 缓存存好,做到检索量再大 TTFT 基本不变。
想看MLA到底怎么工作的?这篇论文用114M模型做实验,发现cKV只记内容不记位置,还能省81%缓存,归纳头也全挤在一层,挺有意思的。
论文用Qwen3-8B做实验,发现KV缓存里的事件行能独立保存计算视图,主动构造回答无关事件能让恢复率从6%跳到51%,对搞Agent记忆的人很有参考价值。
这篇论文提出HiKV,用两阶段KV缓存压缩加专用硬件,7.95倍加速、90%省电,精度几乎不掉。做长上下文LLM推理加速的可以看看。
这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。
这篇论文展示了PagedWeight方法,能在MoE模型服务里动态量化权重,省内存还保准,比之前的方法效果明显更好。
这篇论文提出KVEraser,能快速从大模型KV缓存中擦除指定内容,不用全部重算,1K-32K长度下延迟只增24%,效果接近重算,适合长上下文场景。