论文Agent 与开发者13:16Foil 方法提出循环 MoE 训练新设计:扁平化专家并解绑注意力一篇教你怎么把 MoE 和循环 Transformer 结合的论文,Foil 把专家层数减半、循环翻倍,同等算力下预训练损失更低,代码也开源了。#MoE#Looped Transformer#Foil#开源模型aarXiv cs.LG@Shouren Wang 等 9 人原文稍后读已读值得跟进有用关注 MoE