AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

个性化LLM

共 1 条相关 AI 资讯
7月30日
09:43
09:43官方账号arXiv cs.LG@Peter Li, Prashant Pandey
InferScale 提出一种 GPU 原生的 KV 缓存注入方案,将每个记忆事实的 KV 表示预计算并存储在 GPU 上,服务时直接注入 vLLM 的页式缓存,避免重复预填。他们引入 Chunked RoPE 解决动态组装记忆的位置编码问题,并用 Context-Window Encoding 弥补独立编码缺失的跨事实上下文。在 LoCoMo 基准上,k=50 时 TTFT 降低 72-79%(3.6-4.8x),吞吐量提升 3.7-4.5x,准确率(60.3%)接近带服务时重计算的 Mem0(63.3%)。无需修改引擎或微调模型即可集成到 vLLM。
论文InferScalevLLMKV缓存

推荐理由:看完这篇论文,你就明白怎么让 LLM 在有多层记忆时不再反复重算——InferScale 直接把 KV 缓存存好,做到检索量再大 TTFT 基本不变。
原文
精选全部日报登录