多智能体跑长任务时每个 LoRA 都重算一遍上下文,这篇论文给了一套免训练的共享方案,提速最高 3.1 倍,做 agent 服务的值得看看实现思路。
#KV Cache
共 12 条 · 7 天 0 条 · 30 天 6 条
信息流里打上「KV Cache」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月29日
PReCache:免训练的 KV Cache 共享框架,多 LoRA 智能体 TTFT 提速最高 3.1 倍
9月24日
小米公开 MiMo-V3 核心架构 HySparse2,优化长程多轮 Agent 推理效率
小米把 MiMo-V3 的注意力架构拆开讲了:KV Cache 提前生成、Prefill 少跑一半层数,跑 Agent 时长上下文检索更省更准,细节都在官方这篇说明里。
9月22日
SGLang × Qwen × NVIDIA 三方合作:用 NVFP4 KV Cache 突破长上下文与 Agentic 推理瓶颈
SGLang、Qwen和NVIDIA联手推出NVFP4 KV Cache,4-bit精度下1.78倍容量提升,长上下文推理提速近80%。
9月11日
DeepSeek V4.1 Flash 发布,V4 Pro 计划下线
DeepSeek 直接把自家旗舰 V4 Pro 下线了,换成 V4.1 Flash,说明新模型确实更强,对开发者来说,用 V4.1 Flash 能省不少钱,尤其是处理长上下文和频繁调用的时候。
9月1日
8月6日
7月31日
6月26日
6月12日
GLM-5 大规模部署中的 Scaling Pain 调试与优化
大模型从实验到生产,Scaling Pain 是绕不过的坎。做推理部署的工程师,这篇博客里的 KV Cache 竞态和 HiCache 同步问题很可能你也会遇到,建议直接收藏。
5月25日
DeepSeek:美国最后悔没封杀的中国AI公司,用算法创新重塑硬件生态
DeepSeek 用算法创新打破了 GPU 禁运的困局,做长上下文 Agent 的开发者可以直接用 V4 Pro 体验成本暴降的效果,做硬件生态的团队值得研究其开源架构。