事件专题 · 多源确认

Kernel Forge: 用MCTS优化CUDA内核的开源Agent Harness

Kernel Forge是一个开源agent harness,能直接改写PyTorch模型的CUDA内核。它覆盖视觉、扩散和LLM三类工作负载。采用蒙特卡洛树搜索(MCTS)而非线性生成-修复链,并提供GUI监控进度。在NVIDIA DGX Spark(GB10 GPU)上,经过每核50次优化迭代,它在四个模型中优化了14个内核,使其超越PyTorch基线。性能提升主要来自harness结构和原地重整合,而非更强的LLM。

当前结论

想又快又稳地优化CUDA内核?Kernel Forge用MCTS自动探索,比手动写靠谱多了,实测14个内核超基线。

8 个信源62° AI 热度最后更新 2026/7/29 14:55:02

证据链

相关来源 6Aravind Srinivas
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情