模型多源确认精选00:55vLLM AFD Plugin 发布,实现 MoE 推理 Attention-FFN 分离vLLM 出了个新插件,把 MoE 推理的注意力层和专家层拆分部署,想分别扩缩容就方便了,支持 NVIDIA 和昇腾卡。#vLLM AFD Plugin#MoE#Attention-FFN Disaggregation#Ascend NPU3 个信源在谈事件专题官方账号vLLM@vllm_project4 个信源在谈原文稍后读已读值得跟进有用关注 vLLM AFD Plugin