17:39官方一手arXiv: DeepSeek@Yan Shi, Xiaochao Wang, Jingchun Gao, Jintao Luo, Xinyi Zhou, Feng Liu, Kui Luo, Xushi Li, Xinjie Guo, Liangjun Feng精选73°VPP是一种新的虚拟流水线并行技术,用于优化长上下文LLM推理中的分块预填充。该方法保持块大小固定,通过虚拟流水线布局减少流水线气泡。在vLLM-Ascend中实现后,VPP在16块Ascend 910C NPU上测试了三种MoE模型,序列长度达100万token。相比DCPP,VPP在长序列上吞吐量提升13.1%,在混合工作负载上提升6.7%,在512K token的DeepSeek-V3.1预填充任务中,流水线气泡比例从6.4%降至0.1%。论文VPPLLM推理流水线并行推荐理由:VPP解决了长上下文LLM推理中流水线气泡问题,在保持短序列性能的同时显著提升长序列吞吐。原文稍后读已读值得跟进有用关注 VPP