8月21日
02:05
02:05Philipp Schmid@_philschmid
精选
Awesome Gemma 资源库已在 GitHub 上线。该库收录了 16 个 Gemma 模型变体的模型卡片和合集。它还提供了 Ollama、vLLM 和 LiteRT 的设置指南。此外,库中包含 Unsloth、Tunix 和 MLX 的微调教程。社区项目、应用和演示也包含在内。

推荐理由:Google 的 Awesome Gemma 资源库上线了,里面有你想要的模型卡片、部署指南和微调教程,比自己找方便多了。
8月20日
10:12
10:12官方一手arXiv: Anthropic@José A. Perdiguero López, Miguel A. Durán-Olivencia
Flama是一个开源Python框架,基于Asynchronous Server Gateway Interface(ASGI),用于开发部署生产级web API、机器学习服务和大型语言模型(LLM)应用;其子系统包含依赖注入系统,可从类型注解解析参数,还支持Pydantic等格式;内置JWT认证、WebSocket端点等功能,可通过命令行界面管理应用。
推荐理由:Flama这个开源框架,能帮你开发部署生产级API和LLM服务,和普通框架比更统一架构,还能自动处理多种模型格式。
8月7日
7月24日
03:07
7月23日
14:49
14:49官方账号vLLM@vllm_project
精选
vLLM 项目昨晚举办了回归后的首次 meetup,由 vLLM 与 CrusoeAI、inferact 联合主办。vLLM 核心贡献者 Simon Mo、zlxi02 和 zijingliu 分别介绍了 vLLM 路线图、agentic workloads 以及生产级 vLLM 部署经验。活动还得到了 a16z 的支持。

推荐理由:vLLM 社区又聚在一起了,这次聊了路线图和 agent 负载,还和 CrusoeAI、a16z 联手,挺有料的。
14:21
14:21官方账号vLLM@vllm_project
精选
Macaron 团队发布了 Macaron-V1-Venti,一个基于 vLLM 的多 LoRA 路由系统。其开源组件 MoL Harness 可将多个 LoRA 专家模型统一在 OpenAI 兼容端点后,并自动路由请求。该系统利用了 vLLM 原生的 Multi-LoRA 服务。从发布首日即支持 vLLM。
事件专题

推荐理由:Macaron 搞了个好东西:把多个 LoRA 模型挂在一个接口后,自动路由,基于 vLLM 直接上线。
7月18日
7月14日
13:55
13:55官方账号vLLM@vllm_project
精选
NVIDIA NeMo 团队发布了新的智能体优先强化学习框架 Molt,采用 vLLM(基于 Ray)作为 rollout 引擎。vLLM 支持快速异步服务,最高可扩展至 1T 级 MoE 规模,且易于集成,让上层的强化学习核心保持小巧和可修改。
事件专题

推荐理由:vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。
02:17
02:17官方账号vLLM@vllm_project
精选
Novita Labs 训练并开源了 DSpark 投机解码器,用于 Kimi-K2.6 和 Kimi-K2.7-Code 模型。DSpark 是 DeepSeek 提出的投机解码方法,能一次性生成整个 token 块。vLLM 从 v0.25.0 版本起原生支持 DSpark。使用该解码器可加快 Kimi 系列的推理速度。
推荐理由:DeepSeek 的 DSpark 投机解码,能让 Kimi-K2.6 和 K2.7-Code 一次生成整块 token,配合 vLLM 0.25.0 原生支持,解码更快。
7月13日
14:41
14:41官方账号vLLM@vllm_project
精选
PrimeIntellect推出Verifiers v1,使用vLLM进行训练rollouts,确保精确的token IDs和logprobs。该方法消除了tokenization漂移,使rollouts与训练保持同步。vLLM还支持开源RL基础设施如prime-rl。这一发布提升了强化学习训练的稳定性和效率。
推荐理由:PrimeIntellect发了Verifiers v1,用vLLM做强化学习rollout,token精度更高,训练更稳定。搞开源RL的可以看看。
7月10日
04:53
04:53官方账号vLLM@vllm_project
精选
vLLM项目与Inferact合作,在Ray Summit(8月24-26日于旧金山)举办首届vLLM Conference。会议将讨论vLLM路线图、如何最大化NVIDIA/AMD/TPU等加速器性能、将vLLM集成到训练与推理管线、以及生产级推理经验。演讲嘉宾来自Inferact、NVIDIA、AMD、Google TPU、Anyscale、PyTorch、Meta、Red Hat等。
事件专题

推荐理由:vLLM社区第一次线下大会,想了解高性能推理前沿和开源生态的朋友别错过,直接和NVIDIA、AMD、Google TPU的工程师面对面。
7月9日
7月7日
22:16
13:03
13:03官方一手arXiv: OpenAI@Sukanta Ganguly
PLACEMEM将智能体记忆表示为带版本号的胶囊,统一语义、来源、有效性和可重用运行时状态。原型基于vLLM,支持提示级文本检索、KV导向路由和级联失效。通过OpenAI兼容的侧车和类型化元数据契约,测量了首次token延迟、复用率和校正后行为。论文提出了面向终身智能体系统的重放感知服务集成路线图。
事件专题

推荐理由:这篇论文提出了PLACEMEM,用版本化胶囊解决终身智能体的记忆管理问题,原型跑在vLLM上,实测了延迟和复用率,适合研究记忆架构的读者。
11:48
11:48官方一手arXiv: DeepSeek@Xiao Shi, Yingying Sun, Jiangsu Du, Zhiguang Chen, Yutong Lu
CAP框架通过协同激活驱动的专家放置减少跨设备通信,并引入通信感知剪枝选择性移除路由目标。在单节点和多节点实验中,相比DeepSeek EPLB和vLLM的序列放置,吞吐量提升1.23倍至1.86倍。该方法在达到相同加速目标时能保持更好的模型准确率。
推荐理由:这篇论文提出CAP,直接在专家放置和剪枝中考虑通信开销,实测比DeepSeek EPLB快1.2-1.8倍,适合跑大MoE模型的人。
7月3日
15:45
15:45官方账号vLLM@vllm_project
74°
Qwen3-Omni采用多模态Thinker与Talker(Code2Wav)流水线架构。高并发下仅复制语音阶段,复用Thinker结果,首音频延迟从约6秒降至0.6秒。吞吐量在同GPU上提升5.4倍,语音生成快于实时。该优化由阿里、蚂蚁集团SCT团队和vLLM-Omni团队共同实现。

推荐理由:阿里和蚂蚁团队搞了个优化,Qwen3-Omni实时对话延迟从6秒降到0.6秒,吞吐还翻了5倍多,推荐看技术博客。