vLLM AFD Plugin 发布,实现 MoE 推理 Attention-FFN 分离
vLLM 出了个新插件,把 MoE 推理的注意力层和专家层拆分部署,想分别扩缩容就方便了,支持 NVIDIA 和昇腾卡。
vLLM 出了个新插件,把 MoE 推理的注意力层和专家层拆分部署,想分别扩缩容就方便了,支持 NVIDIA 和昇腾卡。
FlexNPU 解决了LLM推理中prefill和decode阶段资源冲突的痛点,做模型部署和推理优化的团队可以直接参考其动态调度思路,尤其适合使用华为Ascend NPU的开发者。