主要来源arXiv cs.LG
查看原文事件专题 · 多源确认
SparseDitto:用LLM智能体按稀疏模式定制GPU内核
SparseDitto 是一个基于 LLM 智能体的系统,能按矩阵、算子与目标 GPU 自动生成定制内核,覆盖 SpMV、SpMM、SpGEMM 三种稀疏算子。论文指出同一 SpMM 任务中 cuSPARSE 在 CSR 与 Blocked-ELL 格式下性能差距最高达 350 倍,现有实现无法在所有稀疏模式上占优。SparseDitto 在 NVIDIA RTX PRO 6000 上相对 cuSPARSE 取得 2.68 倍几何平均加速,最高 146.61 倍;在 H200 上平均加速 2.79 倍,最高 78.5 倍。其生成的 SpMM 内核还让全批次 GCN 训练最高提速 3.39 倍。
当前结论
不用手写内核了?SparseDitto 用 LLM 智能体自动生成,比 cuSPARSE 平均快 2.7 倍,最高 146 倍。
6 个信源62° AI 热度最后更新 2026/8/5 16:41:03
证据链
相关来源 1LangChain
查看原文相关来源 2NVIDIA AI
查看原文相关来源 3techcrunch
查看原文相关来源 4IT之家
查看原文相关来源 5Latent.Space
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。