vLLM那帮人创业后干的活:把Kimi K2塞进谷歌TPU,速度比英伟达GPU还快57%,框架还是DeepSeek开源的,搞推理的可以看看细节。
#vLLM
Fujitsu 的工程师要在 PyTorch 大会讲怎么用 vLLM 和 OpenVINO 在 ARM CPU 上跑 MoE 模型,做端侧部署的可以关注。
vLLM 的人跑去阿里云大会分享推理经验,讲的是 Agent 时代开源推理怎么演进,做推理部署的可以看看
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
阿里云 Apsara 大会上,vLLM 核心维护者聊了 Qwen3.8-Max 在 Agent 任务上的表现,做开源推理的可以看看他怎么看。
寒武纪搞了个新东西,叫 Day-0,能让 DeepSeek-V4.1-Flash 模型直接在他们的芯片上跑,不用额外优化,挺厉害的。
阿里开源的Qwen3.8-2.4T-A95B模型现在能在AWS SageMaker HyperPod上部署了,教程详细说明了集群配置和量化方法。
Simon Mo是vLLM作者,他讲开源权重模型怎么在成本和控制上赢过闭源API,还吐槽专有API宕机问题,适合做线上服务的开发者。
LoRA 服务老被显存和 PCIe 卡脖子?SALT 用 r≤2 的残差加固定质心,精度追上高秩,vLLM 吞吐最高多 51%。
看完这篇论文,你就明白怎么让 LLM 在有多层记忆时不再反复重算——InferScale 直接把 KV 缓存存好,做到检索量再大 TTFT 基本不变。
PrimeIntellect 用 vLLM 把 agentic RL 搞到万亿参数级了,FP8 加专家并行,28 个 H200 节点跑 131k 序列,每步不到 5 分钟,训练 GLM-5 做 SWE 任务。
vLLM 社区又聚在一起了,这次聊了路线图和 agent 负载,还和 CrusoeAI、a16z 联手,挺有料的。
这个工具专门针对阿拉伯语语音转录,用 Cohere 的模型,跑在 Docker 里插链接或文件就能出文本,做阿拉伯语内容的朋友可以试试。