12:27官方账号arXiv cs.LG@Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen DingSparseDitto 是一个基于 LLM 智能体的系统,能按矩阵、算子与目标 GPU 自动生成定制内核,覆盖 SpMV、SpMM、SpGEMM 三种稀疏算子。论文指出同一 SpMM 任务中 cuSPARSE 在 CSR 与 Blocked-ELL 格式下性能差距最高达 350 倍,现有实现无法在所有稀疏模式上占优。SparseDitto 在 NVIDIA RTX PRO 6000 上相对 cuSPARSE 取得 2.68 倍几何平均加速,最高 146.61 倍;在 H200 上平均加速 2.79 倍,最高 78.5 倍。其生成的 SpMM 内核还让全批次 GCN 训练最高提速 3.39 倍。论文SparseDittoGPU内核稀疏矩阵5 个信源在谈事件专题推荐理由:不用手写内核了?SparseDitto 用 LLM 智能体自动生成,比 cuSPARSE 平均快 2.7 倍,最高 146 倍。原文稍后读已读值得跟进有用关注 SparseDitto
10:44Latent.Space@latentspacepod作者在 @swyx 播客上复盘两个月前的争议言论,坚持认为 megakernels 已死。他的理由是内核复杂度太高,没有推理服务商会在生产中用 67k 行手工融合前向传播内核。他认为 GPU 内核优化是最适合强化学习的任务,AI 代理用 ncu CLI 和 MCP 就能自动调优。他还预测数据中心 Transformer 推理 ASIC 因架构未收敛而失败,NVIDIA 的护城河在于 HBM 容量带宽和软件工具链。行业megakernelsNVIDIAASIC9 个信源在谈事件专题推荐理由:一个工程师复盘自己的神预言:megakernels和推理ASIC都没戏,GPU调优会被RL接管,NVIDIA靠软件和HBM赢。原文稍后读已读值得跟进有用关注 megakernels
14:08IT之家(博客/媒体)83°OpenAI 于7月29日部署 GPT-5.6 Sol 模型优化 GPT-5.6 系列推理链路。该模型通过 Codex 分析生产流量并学习 Triton 和 Gluon 语言,自主改写 GPU 内核,使端到端服务成本降低最多20%。此外,优化推测性解码后,token 生成效率提升超过15%。OpenAI 还使用开源工具 FpSan 验证内核正确性。AI模型GPT-5.6 SolOpenAI推理优化10 个信源在谈事件专题推荐理由:OpenAI 让自家模型 GPT-5.6 Sol 反过来优化自己的推理,成本降了20%,token 生成快了15%,挺有意思的。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
09:14官方一手arXiv: DeepSeek@Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong本文针对长上下文稀疏注意力中的Indexer-TopK操作,指出现有GPU内核如DeepSeek Sparse Attention(DSA)存在全局内存开销大、同步成本高问题。作者利用高维空间中向量距离分布集中的特性,提出LiteTopK内核:通过采样小部分数据估计查询-数据分数范围,在线分桶,维持紧近似阈值并回写有潜力候选。实验在GLM 5.2的预填充阶段实现1.2倍加速,同时降低内存开销,且保持精确Top-k结果。论文LiteTopKDeepSeek Sparse AttentionGLM 5.2推荐理由:这论文用维度诅咒的视角,搞了个LiteTopK算子,比DeepSeek的DSA更快更省内存,GLM 5.2预填充直接快1.2倍。原文稍后读已读值得跟进有用关注 LiteTopK
09:41官方账号Microsoft Research@MSFTResearchGPU内核从SQL自动生成,实现30倍分析加速。AI匹配实验室培养的肿瘤模型,用于癌症治疗。LLM无需重新训练即可跨任务学习。以上是微软研究院最新一期Research Focus的亮点。行业微软研究院SQLGPU内核推荐理由:微软研究院一口气晒了四个硬核进展:SQL秒变GPU代码、AI匹配肿瘤模型、LLM不重训学新任务,都很实在。原文稍后读已读值得跟进有用关注 微软研究院