事件专题 ·多源确认

PyTorch 的 Helion 内核 DSL 集成 vLLM,部分工作负载吞吐提升超 10%

Helion 是 PyTorch 团队推出的内核 DSL,官方博客展示了如何将其集成到 vLLM 的线性后端。一套 Helion GEMM 实现覆盖 Standard GEMM、Split-K 和 Swap-AB 三种算法变体,按张量形状自动选择最优配置。在 NVIDIA Hopper GPU 上,结合逐形状调优与混合调度,性能超过 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,部分工作负载端到端吞吐提升超过 10%。文章作者来自 Red Hat 和 Meta 的 PyTorch 团队。

当前结论

PyTorch 官方把 Helion 接进 vLLM,一套 GEMM 代码自动选最优算法,在 Hopper 上跑赢 CUTLASS 和 DeepGEMM,搞推理部署的可以看看。

11 个信源61° AI 热度最后更新 2026/10/2 20:05:25

证据链

11 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。