#稀疏MoE
共 7 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「稀疏MoE」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月3日
7月31日
7月23日
Poolside发布Laguna S 2.1:118B稀疏MoE模型,8B激活1M上下文
Poolside新出的Laguna S 2.1模型,稀疏MoE只激活8B就能达到1M上下文,还能本地跑在DGX Spark上,写代码和长期任务都很顺手。
6月8日
LightningLM 0.1V:单节点8卡训练120B稀疏MoE
这篇论文解决了大模型训练资源门槛高的问题——单节点8卡就能训120B模型,做MoE和模型扩展的团队可以直接参考其状态保持原则和TQP策略,省下大量硬件成本。
6月4日
Step 3.7 Flash:198B稀疏MoE视觉语言模型,推理效率优先
多数实验室事后才考虑推理效率,而 Step 3.7 Flash 从设计之初就为推理优化,做智能体应用和视觉语言模型的开发者可以直接试用,感受 400 tok/sec 的流畅体验。
5月13日
5月12日