如果你的 Agent 跑得慢、GPU 显存被 KV cache 吃满,这篇 NVIDIA Dynamo 的博客讲了 router 加 KV-cache manager 怎么复用上下文,值得照着调优。
#推理优化
H-Company 聊了怎么用 NVIDIA Dynamo 优化跑 Computer Use 智能体的 VLM 服务,做 agent 推理部署的可以看看他们的实践。
37FlowAI 拆解了 DeepSeek-V4.1-Flash 在 vLLM 上跑 agent 的优化细节,SWA bounded replay 能明显降低 TTFT,搞部署的可以看看。
搞推理部署的可以看看:B200 上 4:8 稀疏让 MoE 专家层快 1.35-1.65 倍,Kimi-K2.5 实测也有 1.18 倍。
做 RL 训练或大规模推理部署的可以看,DeepSeek-V3 权重同步直接从 5.78 秒砍到 2.77 秒,还是进 NCCL 的正经方案。
跑长程智能体的开发者看看:KV-Cache 复用会导致同一提示词输出不同,论文给了文档对齐重算方案,波动从 69% 降到 26%,还保住 5.7 倍提速。
OpenAI 把 GPT 6 Astra 和 6.1 Sol 的推理提速了 50%,所有 ChatGPT 计划都能用上,几小时内推送完。
vLLM 官方点名感谢开发者 Abhinandan,他给 semantic-router 和 Mooncake 都提交了代码,做推理优化的可以关注下这两个项目。
12G显存的电脑也能跑125B的Qwen3.8-Flash-Next了,Strata把常用专家放显卡、全量放内存,项目已在Github开源。
MoE 推理部署的人可以看看,DeepSeek-V4 和 GLM-5.3 上实测 TTFT 快了近一半,思路是让专家计算别干等慢副本。
vLLM 和 LMCache 里能直接用的 KV 缓存调度优化,快速层容量从 100 GiB 砍到 25 GiB 吞吐基本不掉,还把 p95 首 token 时间降了 48%。
跑 MoE 显存不够的人可以看看:微调路由加专家,Mixtral-8x7B 每层只缓存 4 个专家,取回次数降了 23.7%,速度更快精度还涨。
多智能体跑长任务时每个 LoRA 都重算一遍上下文,这篇论文给了一套免训练的共享方案,提速最高 3.1 倍,做 agent 服务的值得看看实现思路。
Chamath 用两句话讲清了推理时 prefill 和 decode 的区别,想搞懂为什么 Nvidia 在长上下文里占优的可以看看。
一篇推理系统论文,解决多模态模型 Encode 阶段拖垮 GPU 利用率的问题,goodput 比 vLLM 高 1.7 倍、比 NVIDIA Dynamo 高 4.3 倍,做 MLLM 服务的可以看看。
量化小模型的人可以看看:一个一行搜索就能让输出头 W4 量化的 KL 误差降七成的方法,还附 10.8% 延迟实测。
Fujitsu 的工程师要在 PyTorch 大会讲怎么用 vLLM 和 OpenVINO 在 ARM CPU 上跑 MoE 模型,做端侧部署的可以关注。
Kimi K3 在 TPU 上跑到 709 tokens/s,比 GB200 还快,92 个 MoE 层塞进一个 Pallas kernel,做法挺巧,做推理的可以看看。
教你怎么在普通 PCIe 显卡上跑 DeepSeek 推理,改内核加重构通信后吞吐翻近 7 倍,1.5 台 6000D 就能打赢一台 B300,省钱党必看。
一篇改注意力机制的论文:value 不再做投影,改查 token 记忆表,推理还能省显存,做模型结构的可以看看。
arXiv 上一篇讲 KV 缓存的新论文,用本地历史替换当前 token 分支,126M 模型上困惑度降了约 1.4%,做推理优化的人可以看看。
亚马逊 SageMaker HyperPod 新增模型缓存功能,能将推理冷启动时间从数分钟缩短到秒级,比之前版本快很多。