7月26日
02:15
02:15官方一手marktechpost@Sana Hassan
精选
TileLang是一种高级Python领域特定语言,用于简化高性能GPU内核设计。教程演示如何实现分块Tensor-Core GEMM、融合Softmax和FlashAttention等复杂工作负载。TileLang编译器自动处理线程映射、内存布局和底层CUDA指令生成。同时支持自动调优,帮助用户优化内核性能。
推荐理由:想写GPU内核但被CUDA细节劝退?TileLang用Python帮你搞定Tensor-Core GEMM和FlashAttention,自动处理线程映射和调优,省心。
6月12日
12:20
12:20官方账号Tri Dao (FlashAttention)@tri_dao
精选
通过数学重写,研究者发现 Transformer 的所有操作本质上可以归结为一系列 GEMM(通用矩阵乘法)加 epilogue(后处理)。这意味着只要提供几个优化好的基础原语,LLM 甚至新手人类都能为所有 Transformer 操作编写达到光速的内核。这一发现简化了模型优化,让高性能内核的编写门槛大幅降低。
推荐理由:对做模型推理优化和内核开发的团队来说,这揭示了 Transformer 的底层统一结构,可以直接用 LLM 生成高效代码,建议关注。