D2K-Bench 基准测试:LLM Agent 能否把专家设计转化为高效 GPU 内核
arXiv 上的新基准 D2K-Bench,26 个任务测 LLM 写 GPU 内核,加上专家指导后 GPT-6-Astra 等模型的加速比从 1.69 倍冲到 2.49 倍,结果挺有意思。
arXiv 上的新基准 D2K-Bench,26 个任务测 LLM 写 GPU 内核,加上专家指导后 GPT-6-Astra 等模型的加速比从 1.69 倍冲到 2.49 倍,结果挺有意思。
OpenAI 让自家模型 GPT-5.6 Sol 反过来优化自己的推理,成本降了20%,token 生成快了15%,挺有意思的。
这论文用维度诅咒的视角,搞了个LiteTopK算子,比DeepSeek的DSA更快更省内存,GLM 5.2预填充直接快1.2倍。