#DeepSeek Sparse Attention
共 2 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「DeepSeek Sparse Attention」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月4日
7月15日
论文09:14
LiteTopK:利用维度灾难优化稀疏注意力融合Indexer-TopK内核这论文用维度诅咒的视角,搞了个LiteTopK算子,比DeepSeek的DSA更快更省内存,GLM 5.2预填充直接快1.2倍。
这论文用维度诅咒的视角,搞了个LiteTopK算子,比DeepSeek的DSA更快更省内存,GLM 5.2预填充直接快1.2倍。