12:27官方账号arXiv cs.LG@Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen DingSparseDitto 是一个基于 LLM 智能体的系统,能按矩阵、算子与目标 GPU 自动生成定制内核,覆盖 SpMV、SpMM、SpGEMM 三种稀疏算子。论文指出同一 SpMM 任务中 cuSPARSE 在 CSR 与 Blocked-ELL 格式下性能差距最高达 350 倍,现有实现无法在所有稀疏模式上占优。SparseDitto 在 NVIDIA RTX PRO 6000 上相对 cuSPARSE 取得 2.68 倍几何平均加速,最高 146.61 倍;在 H200 上平均加速 2.79 倍,最高 78.5 倍。其生成的 SpMM 内核还让全批次 GCN 训练最高提速 3.39 倍。论文SparseDittoGPU内核稀疏矩阵推荐理由:不用手写内核了?SparseDitto 用 LLM 智能体自动生成,比 cuSPARSE 平均快 2.7 倍,最高 146 倍。原文稍后读已读值得跟进有用关注 SparseDitto