10:45官方一手arXiv: DeepSeek@Yongxiang Lyu, Ning Li, Bonian Jia精选SPICE结合轻量级专家预测和置信度感知CPU-GPU编排,实现MoE推理加速。在DeepSeek-V2-Lite和Qwen2-57B-A14B上测试,TPOT速度提升达3.12倍,质量损失最小。AI模型MoE推理加速轻量级预测CPU-GPU编排推荐理由:SPICE框架结合轻量级预测和编排,显著提升MoE推理速度,值得研究。原文稍后读已读值得跟进有用关注 MoE推理加速
10:47官方一手arXiv: DeepSeek@Zongfei Li精选一项新研究质疑稀疏MoE路由器中专家选择与输出加权是否应使用相同分数。在预训练的OLMoE-1B-7B上,仅改变集合内聚合方式,结构化oracle将全周期交叉熵提升0.0160±0.0039。研究者训练了301K参数的FDAA后处理头,在冻结主干、路由器和专家的情况下,将WikiText-103测试集Delta CE提升至-0.1523±0.0031。在DeepSeek-V2-Lite上复现固定调度审计,路由器Top1识别最佳选中专家的比例仅为12.5%和16.7%。结果表明专家选择与专家承诺应跨架构区分。论文MoEOLMoEDeepSeek-V2-Lite推荐理由:这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。原文稍后读已读值得跟进有用关注 MoE
09:48官方一手arXiv: DeepSeek@Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle精选该论文针对分离式LLM服务中预填充节点过载而解码节点空闲的问题,提出了一种主动预填充偏转调度器。在2个预填充节点和2个解码节点的A100集群上,预填充执行仅占P95首次令牌延迟的2-23%,其余为排队和KV-cache传输。该调度器让解码节点以分块预填充步骤穿插解码批次的方式处理请求,消除节点间KV传输。基于vLLM和DeepSeek-V2-Lite的实验显示,相比最优分离式调度器,P95 TTFT降低81%,SLO达成率提升79%。论文Disaggregated LLM servingprefill deflectionvLLM推荐理由:这篇论文讲了个很实在的优化:让空闲的解码节点分担预填充活儿,不用等KV传输,TTFT降了81%原文稍后读已读值得跟进有用关注 Disaggregated LLM serving