6月12日
12:20
12:20官方账号Tri Dao (FlashAttention)@tri_dao
精选
WentaoGuo7 提出了一种对混合专家模型(MoE)反向传播的数学重写方法,显著降低了激活内存占用,并大幅提升了训练速度,尤其适用于细粒度MoE。该方法还利用了NVIDIA Blackwell架构的新特性(如2CTA MMA和CLC)来构建超快MoE内核。这一进展对于训练大规模MoE模型的团队具有重要意义,能有效缓解内存瓶颈并加速迭代。
事件专题

推荐理由:做MoE模型训练和推理的开发者,这个数学重写能直接降低你的显存压力并加速训练,尤其适合细粒度MoE场景,建议试试Blackwell新特性带来的性能提升。
5月19日
14:30
14:30官方账号arXiv cs.AI@Stephen Mell, David Mell, Konstantinos Kallas, Steve Zdancewic, Osbert Bastani
精选
复合AI应用(如用Python调用多个ML模型)的端到端延迟成为瓶颈,传统编译器无法优化外部组件调用。PopPy系统通过结合编译时分析和运行时调度,自动识别并并行化Python中调用外部组件的代码段。它解决了Python语言复杂性、动态分发和变量突变三大挑战,在真实复合AI应用中实现最高6.4倍加速。开发者只需少量标注即可获得并行化收益,且保持程序语义不变。
推荐理由:复合AI应用开发者终于有了一个无需重写代码就能加速的工具——PopPy自动找出并行机会,做多模型编排或自动化管道的团队值得一试。