#vLLM
vLLM 的 Semantic Router 出了 Decision 2.0,一次前向就能同时答多个问题还带各选项概率,做路由和分类的可以看看。
37FlowAI 拆解了 DeepSeek-V4.1-Flash 在 vLLM 上跑 agent 的优化细节,SWA bounded replay 能明显降低 TTFT,搞部署的可以看看。
vLLM 花三周把 DeepSeek-V4.1-Flash 跑快了 1.9 倍,AgentX 上吞吐 5.3 倍,还附交互图表拆解过程,做部署的可以看看。
有 Intel Arc Pro B70 的朋友可以试试这个开源工具,现在能直接用 vLLM 跑本地模型了,不用折腾命令行。
vLLM 联合 KR Labs 出的 Vela 2.0,一次调用就能做安全检查、领域分类和 PII 识别,四个尺寸可选,Apache-2.0 开源。
搞推理部署的可以看看:B200 上 4:8 稀疏让 MoE 专家层快 1.35-1.65 倍,Kimi-K2.5 实测也有 1.18 倍。
有人把 Claude Code、Codex 这些 harness 全改成了 RL 环境,接 vLLM 就能自己设计奖励,训练后工具调用少了 31%。
vLLM 和开源基金会 10 月 16 号在旧金山办 Open Together,搞开源 AI 的可以去看看。
PyTorch 官方宣布的活动,Red Hat、NVIDIA、IBM 三家联合办,讲 vLLM、Ray 这些工具怎么进企业生产环境,搞部署的可以关注
Google 刚发布的 EmbeddingGemma 2 能把文字、图片、音频、视频都转成向量,vLLM 当天就能跑,做 RAG 检索的可以试试 nightly 版。
有人在 DGX Spark 上用自写的 vLLM 补丁跑 DiffusionGemma 和 Jev 对比,vLLM 官方都转发了,想看扩散模型推理性能的可以点进去。
vLLM 和 Hugging Face 一起办开源 AI 开发者聚会,10 月 16 日在旧金山 The Midway,在湾区的话可以去认识一圈开源圈的人。
PyTorchCon 北美大会下个月开,两天议程全围绕 vLLM、Ray、DeepSpeed 这些开源框架,做推理和训练的可以去看看。
Hugging Face 把 Claude Code、Codex 这些真实编程工具直接当 RL 训练环境用,不用改一行代码,LFM2.5-2.6B 训练后 OpenCode 成绩从 34% 涨到 58%,全套开源可复现。
有人在单张 RTX 5090 上跑 Qwen3-Omni,用 AWQ-4bit 把首音频延迟从 213ms 压到 23ms,本地语音对话流畅度差了近十倍。
vLLM 官方点名感谢开发者 Abhinandan,他给 semantic-router 和 Mooncake 都提交了代码,做推理优化的可以关注下这两个项目。
Prime Intellect 做了个兼容 OpenAI API 的推理平台,跑开源模型速度到 101 tok/s,还支持按需付费的 Serverless 模式。
PyTorch 官方把 Helion 接进 vLLM,一套 GEMM 代码自动选最优算法,在 Hopper 上跑赢 CUTLASS 和 DeepGEMM,搞推理部署的可以看看。
vLLM 的语义路由更新了,0.6B 到 27B 的开源模型一次前向就能判断 64 个请求属性,Apache-2.0 直接可用。
Prime Intellect 用 vLLM 把 GLM-5.3 跑到大规模推理,还拆解了智能体负载下的调度和工具调用坑,做推理服务的人可以看看。
vLLM 和 Cohere 在多伦多办开源 meetup,vLLM 核心维护者会讲路线图,NVIDIA 工程师聊智能体调试,在附近的话可以去现场聊聊。
IQuest 新出的 320B 编程模型 IQuest-Q1,vLLM 首日就能跑,上下文到 52 万 token,想本地部署智能体编程的可以看看。
vLLM 和 LMCache 里能直接用的 KV 缓存调度优化,快速层容量从 100 GiB 砍到 25 GiB 吞吐基本不掉,还把 p95 首 token 时间降了 48%。
AI21 Labs 放出了两场演讲视频,一场讲 RAG 分块该更新打法了,一场用破案的方式带你排查 vLLM 问题,做工程的朋友可以看看。