论文12:28MESH:面向混合专家训练的内存高效Sinkhorn优化MoE 训练显存吃紧?MESH 方法砍掉六成优化器内存,损失只差一点,做大规模训练的可以试试。#MESH#Sinkhorn#混合专家模型#内存优化aarXiv: DeepSeek@Masato Fujitake原文稍后读已读值得跟进有用关注 MESH