7月28日
00:12
7月11日
09:43
09:43Fireworks AI@FireworksAI_HQ
精选74°
MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。

推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。
7月2日
6月16日
10:37
10:37IT之家博客/媒体
71°
Tensordyne 发布 Napier 推理系统,宣称能效是 NVIDIA Blackwell 系统的 17 倍,吞吐量达 13 倍。Napier 采用对数数学设计简化乘法运算,由台积电 3nm 制程生产。TDN72 集成 72 颗芯片,机柜级系统可支持 1000 Token/s/user 的 LLM 推理。
事件专题

推荐理由:Tensordyne 搞了个叫 Napier 的推理芯片,用对数数学省掉了乘法,据说比 NVIDIA Blackwell 快 13 倍,能耗还低 17 倍。初创敢叫板老黄,看看值不值。
6月12日
12:20
12:20官方账号Tri Dao (FlashAttention)@tri_dao
精选
WentaoGuo7 提出了一种对混合专家模型(MoE)反向传播的数学重写方法,显著降低了激活内存占用,并大幅提升了训练速度,尤其适用于细粒度MoE。该方法还利用了NVIDIA Blackwell架构的新特性(如2CTA MMA和CLC)来构建超快MoE内核。这一进展对于训练大规模MoE模型的团队具有重要意义,能有效缓解内存瓶颈并加速迭代。
事件专题

推荐理由:做MoE模型训练和推理的开发者,这个数学重写能直接降低你的显存压力并加速训练,尤其适合细粒度MoE场景,建议试试Blackwell新特性带来的性能提升。
12:19
12:19官方账号Tri Dao (FlashAttention)@tri_dao
精选
一位开发者宣布,快速 muon 优化器即将支持消费级显卡。所有代码均以 matmul + epilogue 形式编写,因此一旦为 Blackwell 消费级显卡实现了主循环,所有高级对称矩阵乘法即可自动获得光速性能。这意味着普通用户也能在自家显卡上高效运行该优化器,无需依赖专业硬件。
推荐理由:这个优化器让消费级显卡也能跑出专业级训练性能,做模型微调或自训练的开发者可以直接关注,省下买高端硬件的钱。