#vLLM
AMD给vLLM生态的RL训练框架vime加了ROCm支持,现在你的Qwen3-8B在MI355X上能跑到4100 tokens/gpu/s,训练和rollout的logprob很稳,还直接提供预构建容器,省去编译麻烦。
vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。
Hugging Face 把 Transformers 模型直接跑进 vLLM,性能不输手写,以后搞推理不用重复造轮子了。
DeepSeek 的 DSpark 投机解码,能让 Kimi-K2.6 和 K2.7-Code 一次生成整块 token,配合 vLLM 0.25.0 原生支持,解码更快。
PrimeIntellect发了Verifiers v1,用vLLM做强化学习rollout,token精度更高,训练更稳定。搞开源RL的可以看看。
vLLM新版本把Model Runner V2设成了默认,推理更快更稳,还新增了流解析和推测解码,想优化部署性能的话可以关注。
把Codex、DeepSeek-R1、vLLM的大佬凑一起了,做AI编程和推理的别错过,比刷推特干货多。
vLLM社区第一次线下大会,想了解高性能推理前沿和开源生态的朋友别错过,直接和NVIDIA、AMD、Google TPU的工程师面对面。
MosiAI 新发的 0.9B 开源模型,一次性搞定多人对话的转录、打标签和加时间戳,90 分钟音频都不用分块,还支持关键词纠偏,赶紧试试。
vLLM和Hugging Face搞了个大活:Transformers v0.25.0直接兼容vLLM,450多个模型自动加速,不用自己写适配代码了,开箱即用!
MistralAI 的 Leanstral 1.5 用 6B 活跃参数就拿下 miniF2F 满分,每个问题才 4 美元,做数学证明的可以试试。
这篇论文讲了个很实在的优化:让空闲的解码节点分担预填充活儿,不用等KV传输,TTFT降了81%
DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。
Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。
Suhail 亲自招人做模型底层优化,玩 vLLM 和 sglang 的可以看看,机会难得。
vLLM 社区正在把 DeepSeek 的 DSpark 算法加进来,推理速度能再上一个台阶,用 vLLM 的朋友可以期待了。
想不依赖数据中心自己跑 550B 模型?NVIDIA 出了详细教程,四台 DGX Spark 就能拼出 OpenAI 兼容的端点。
百度开源了Unlimited-OCR,在vLLM上跑,能一次性解析整本书,内存不涨,比DeepSeek-OCR快35%,做文档OCR的好东西。
vLLM 第一时间给 Liquid AI 的 LFM2.5 小模型做了适配,230M 参数跑 agent 任务,手机、机器人上都能用。
vLLM 和 NVIDIA 合作推出 DFlash 投机解码,Gemma-4 31B 推理速度提升近 6 倍,配置只需改一行 checkpoint 路径。
Anyscale 和 Google Cloud 联手让 vLLM 推理快了好几倍,预填负载快 4.4 倍,解码负载快 24 倍,用 Ray V2 执行器就能体验。