10:45官方一手arXiv: DeepSeek@Yongxiang Lyu, Ning Li, Bonian Jia精选SPICE结合轻量级专家预测和置信度感知CPU-GPU编排,实现MoE推理加速。在DeepSeek-V2-Lite和Qwen2-57B-A14B上测试,TPOT速度提升达3.12倍,质量损失最小。AI模型MoE推理加速轻量级预测CPU-GPU编排推荐理由:SPICE框架结合轻量级预测和编排,显著提升MoE推理速度,值得研究。原文稍后读已读值得跟进有用关注 MoE推理加速