主要来源vLLM
查看原文事件专题 · 多源确认
vLLM v0.23.0 发布:408 次提交,DeepSeek-V4 支持增强
vLLM v0.23.0 包含 408 次提交,来自 200 位贡献者(63 位新贡献者)。主要亮点:DeepSeek-V4 在多个后端上成熟,引入 TRTLLM-gen attention 内核、与 V3.2 解耦的稀疏 MLA 以及用于 Mega-MoE 的 EPLB 调度。Model Runner V2 现已成为 Llama 和 Mistral 稠密模型的默认运行器。新增 Gemma 4 Unified(无编码器)及 MTP 支持。还提供了多层级 KV 缓存卸载(含对象存储层)和统一的推理与工具调用解析器。
当前结论
vLLM v0.23.0 大更新,DeepSeek-V4 和 Llama 用户值得升级,新的 KV 缓存卸载能省显存,推理与工具调用解析也更顺了。
5 个信源73° AI 热度最后更新 2026/6/16 12:16:08
证据链
相关来源 1SuperTechFans
查看原文相关来源 2AWS Machine Learning Blog
查看原文相关来源 3Philipp Schmid
查看原文相关来源 4@atomic_chat_hq
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。