主要来源PyTorch
查看原文事件专题 ·单一信源
vLLM 推出弹性专家并行,可在运行中增减 GPU
vLLM 新增 Elastic Expert Parallelism(弹性专家并行)功能,允许在 MoE 部署运行期间增减 GPU,且对服务中断和停机影响极小。NVIDIA 的 Itay Alroy 将在 PyTorch Conference North America 2026 上介绍 Elastic EP 的架构、关键实现细节和路线图。演讲还将讨论 EP 规模变化时的行为,以及 NIXL EP 如何在实时流量下实现扩缩容。
当前结论
vLLM 的 MoE 服务现在能在线加减 GPU 不停机,NVIDIA 的人在 PyTorch 大会上讲实现细节,做推理部署的别错过。
2 个信源76° AI 热度最后更新 2026/9/26 07:00:00
证据链
2 个信源相关来源 1arXiv cs.LG
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。