主要来源elvis
查看原文事件专题 · 多源确认
Kernel Forge: 用MCTS优化CUDA内核的开源Agent Harness
Kernel Forge是一个开源agent harness,能直接改写PyTorch模型的CUDA内核。它覆盖视觉、扩散和LLM三类工作负载。采用蒙特卡洛树搜索(MCTS)而非线性生成-修复链,并提供GUI监控进度。在NVIDIA DGX Spark(GB10 GPU)上,经过每核50次优化迭代,它在四个模型中优化了14个内核,使其超越PyTorch基线。性能提升主要来自harness结构和原地重整合,而非更强的LLM。
当前结论
想又快又稳地优化CUDA内核?Kernel Forge用MCTS自动探索,比手动写靠谱多了,实测14个内核超基线。
8 个信源62° AI 热度最后更新 2026/7/29 14:55:02
证据链
相关来源 1Junyang Lin
查看原文相关来源 2Cognition
查看原文相关来源 3arXiv cs.AI
查看原文相关来源 4NVIDIA AI
查看原文相关来源 5The Rundown AI
查看原文相关来源 6Aravind Srinivas
查看原文相关来源 7Amjad Masad
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。