02:33Fireworks AI@FireworksAI_HQ精选76°Fireworks AI 和 MiniMax 联合公开了 MiniMax Sparse Attention(MSA)内核的代码仓库。Fireworks 优化了注意力内核的加载与存储流水线,实现了 1.6 倍吞吐量提升。两个内核仓库已分别在 GitHub 上开源(fw-ai/minimax-… 和 MiniMax-AI/MSA…)。这项工作旨在推动开源实现的实际价值。AI模型Fireworks AIMiniMaxMSA推荐理由:Fireworks 和 MiniMax 把稀疏注意力内核开源了,实测吞吐快了1.6倍,搞推理优化的不可错过。原文稍后读已读值得跟进有用关注 Fireworks AI
23:33官方一手marktechpost@Asif Razzaq精选MiniMax 发布 Sparse Attention (MSA) 机制,基于 Grouped Query Attention (GQA) 架构。MSA 包含一个轻量级索引分支,为每个查询和 GQA 组选择 Top-k 键值块;主分支仅关注这些块。在 1M 上下文长度下,每个 token 的注意力计算量减少 28.4 倍。该机制训练在 109B 参数的 MoE 模型上,使用 3T token 预算,下游基准测试中与 GQA 性能相当。AI模型MiniMaxMSA稀疏注意力推荐理由:MiniMax 搞了个新稀疏注意力 MSA,1M 上下文计算量降 28 倍,准度却一点没掉,适合长文本场景。原文稍后读已读值得跟进有用关注 MiniMax