论文Agent 与开发者13:49TempoKV:让 LLM KV 缓存调度更省内存的分层方案vLLM 和 LMCache 里能直接用的 KV 缓存调度优化,快速层容量从 100 GiB 砍到 25 GiB 吞吐基本不掉,还把 p95 首 token 时间降了 48%。#TempoKV#vLLM#LMCache#KV缓存aarXiv cs.AI@Jay H. Park 等 3 人原文稍后读已读值得跟进有用关注 TempoKV