09:43官方账号arXiv cs.LG@Peter Li, Prashant PandeyInferScale 提出一种 GPU 原生的 KV 缓存注入方案,将每个记忆事实的 KV 表示预计算并存储在 GPU 上,服务时直接注入 vLLM 的页式缓存,避免重复预填。他们引入 Chunked RoPE 解决动态组装记忆的位置编码问题,并用 Context-Window Encoding 弥补独立编码缺失的跨事实上下文。在 LoCoMo 基准上,k=50 时 TTFT 降低 72-79%(3.6-4.8x),吞吐量提升 3.7-4.5x,准确率(60.3%)接近带服务时重计算的 Mem0(63.3%)。无需修改引擎或微调模型即可集成到 vLLM。论文InferScalevLLMKV缓存推荐理由:看完这篇论文,你就明白怎么让 LLM 在有多层记忆时不再反复重算——InferScale 直接把 KV 缓存存好,做到检索量再大 TTFT 基本不变。原文稍后读已读值得跟进有用关注 InferScale