主要来源arXiv cs.AI
查看原文事件专题 ·多源确认
D2K-Bench 基准测试:LLM Agent 能否把专家设计转化为高效 GPU 内核
D2K-Bench 是一个包含 26 个任务和 85 个工作负载的诊断型基准,用于衡量 LLM Agent 在专家设计指导(L1 算法洞察、L2 数据流设计、L3 底层优化技巧)下生成 GPU 内核的效率。在 NVIDIA B200 GPU 上测试五个模型,专家指导使 130 个模型-任务对的正确率从 93.1% 提升到 98.5%,26 个任务的 Performance Score 从 1.46 升至 1.95。GPT-6-Astra、Claude-Opus-4.8 和 GPT-5.6-Sol 三个前沿模型的几何平均加速比从 1.69 倍提高到 2.49 倍。五个模型的平均综合实现得分从 57 分提升到 70 分(满分 100)。
当前结论
arXiv 上的新基准 D2K-Bench,26 个任务测 LLM 写 GPU 内核,加上专家指导后 GPT-6-Astra 等模型的加速比从 1.69 倍冲到 2.49 倍,结果挺有意思。
11 个信源38° AI 热度最后更新 2026/10/2 12:42:12
证据链
11 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。