19:02官方一手arXiv: DeepSeek@Rongfeng Wang, Shichao Weng, Zhiqiang Wang, Xinyu Liu, Yang Yi, Peilong Zhou, Hongwei Tang精选73°MetaNet提出了一种支持集控制器,可为每层预测专家保留阈值和有界路由偏差。在DeepSeek-MoE-16B-Chat模型上,保守设置激活专家数减少40%,MMLU准确率0.489;激进设置激活专家减少62%,准确率下降3.7个百分点。MMLU训练的控制器无需重训即可迁移到C-Eval,激活专家减少52%,准确率达0.386。论文MetaNetMoEDeepSeek-MoE-16B-Chat1 个信源在谈事件专题推荐理由:MetaNet让MoE模型根据任务难度动态分配专家,大幅减少计算量同时保持准确率。原文稍后读已读值得跟进有用关注 MetaNet