论文Agent 与开发者13:35MaskCoFT:掩码协同微调降低 MoE 推理显存开销跑 MoE 显存不够的人可以看看:微调路由加专家,Mixtral-8x7B 每层只缓存 4 个专家,取回次数降了 23.7%,速度更快精度还涨。#MaskCoFT#Mixtral-8x7B#DeepSeek-V2-Lite#MoEaarXiv: DeepSeek@Junfeng Wu 等 6 人原文稍后读已读值得跟进有用关注 MaskCoFT