主要来源vLLM
查看原文事件专题 · 多源确认
vLLM AFD Plugin 发布,实现 MoE 推理 Attention-FFN 分离
vLLM 项目发布实验性插件 vLLM AFD Plugin,由 Ascend、vLLM、阶跃星辰、蚂蚁集团、FastAFD 联合开发。该插件针对 MoE 模型提出 Attention-FFN Disaggregation(AFD)方案,将注意力和专家/FFN 路径作为独立服务运行,支持独立扩缩容。AFD 运行在 NVIDIA GPU 和 Ascend NPU 上,无需 fork 即可使用相同 vLLM 服务接口。
当前结论
vLLM 出了个新插件,把 MoE 推理的注意力层和专家层拆分部署,想分别扩缩容就方便了,支持 NVIDIA 和昇腾卡。
3 个信源58° AI 热度最后更新 2026/7/24 16:55:40
证据链
相关来源 1LMSYS Org (SGLang)
查看原文相关来源 2NVIDIA AI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。