18:45官方一手arXiv: DeepSeek@Gokulakannan Sakthivel, Jerry Wu, Amogh Rajendra, Giriprasad Radhakrishnan精选73°研究测量了OLMoE-1B-7B、DeepSeek-V2-Lite和Qwen3-30B-A3B三种MoE模型上的三种推理优化效果。Fused Triton内核在隔离测试中达到5.6x至9.0x加速,但端到端实际效果仅为0.999x,远低于1.07x的理论上限。INT4量化平均每位置仅改变8个专家中的0.53个,且通过全精度权重重放这些改变路线仅造成2.7%的质量损失。论文Mixture-of-ExpertsOLMoE-1B-7BDeepSeek-V2-Lite推荐理由:论文揭示了MoE模型中三种推理优化为何实际效果不佳,对模型部署有重要参考价值。原文稍后读已读值得跟进有用关注 Mixture-of-Experts