这篇论文直击 AI 智能体重复计算同一文档的浪费痛点,做 LLM 推理优化或智能体基础设施的团队值得关注——它提出的 KV 缓存共享方案可能大幅降低推理成本,且已有实测数据支撑。
#KV缓存
共 55 条 · 7 天 5 条 · 30 天 18 条
6月12日
论文09:06
Can I Buy Your KV Cache? 论文提出预计算 KV 缓存共享方案6月9日
AGENTSERVESIM:面向多轮LLM Agent服务的硬件感知模拟器
做LLM Agent服务部署和优化的团队,终于有了一个低成本、高精度的模拟工具来测试调度和缓存策略,不用再烧GPU时间试错,建议直接看论文细节。
6月5日
6月3日
论文12:49
Self-Pruned Key-Value Attention:让LLM只保留未来有用的记忆KV缓存是长上下文推理的瓶颈,这篇论文用自学习剪枝解决了内存爆炸问题,做LLM推理优化或长文本应用的开发者可以直接参考其方法。
5月29日
VideoMLA:低秩潜变量KV缓存实现分钟级自回归视频扩散
视频生成团队终于有了解决长序列KV缓存内存爆炸的方案——VideoMLA将内存减少92.7%且不牺牲质量,做长视频扩散的开发者可以直接在B200上试,吞吐量提升1.23倍。
5月28日
产品22:12
慧荣发布AI负载优化SSD主控SM2524XT:14GB/s,DRAM-lessAI PC和边缘推理场景的存储瓶颈终于有了针对性解决方案,做AI硬件或部署本地模型的开发者值得关注这款主控的实际表现。
IT之家原文
小米 MiMo API 降价最高 99%,罗福莉详解技术原因
小米 MiMo 用架构和推理优化把 API 价格打下来,做 AI 应用开发的团队可以直接用更低成本调用高性能模型,建议关注后续技术博客。
IT之家原文
5月22日
LCGuard:多智能体系统中安全KV缓存共享的潜在通信防护框架
多智能体系统开发者终于有了保护KV缓存中隐式敏感信息的方案——LCGuard在不牺牲任务性能的前提下阻断信息重建攻击,做分布式AI协作的团队值得关注。
5月20日
5月14日
Stateful Transformers 实现流式推理 5.9 倍加速
流式推理场景(如实时数据监控、金融交易、对话系统)的开发者终于有了降低延迟的可行方案——把预填充移出关键路径,查询延迟与上下文大小解耦。做高吞吐低延迟推理服务的团队值得关注这个新范式。
5月13日
KV-Fold:无需训练的长上下文推理协议,单步KV缓存递归
KV-Fold 用简单的左折叠思路解决了长上下文推理的内存和精度痛点,做 LLM 推理优化或长文档处理的团队可以直接在现有模型上尝试,无需额外训练。