事件专题 ·官方一手

AI与HPC交叉的模板计算研究

TinyTC和OpenAI Triton等张量编译器最初为AI工作负载开发,但相同的平铺和内存抽象可应用于实现科学和工业应用的高效高阶模板。研究团队实现了8阶25点声学模板,在GPGPUs上比较TinyTC与PyTorch/Triton实现。在Battlemage B580上,TinyTC达到15.6 Gpts/s,而PyTorch/Triton为13.5 Gpts/s。零初始化运行因硬件内存压缩可达35.8 Gpts/s。

当前结论

TinyTC团队展示了AI编译器如何优化HPC模板计算,在Intel GPU上性能领先,PyTorch/Triton则提供跨厂商开发基准。

6 个信源73° AI 热度最后更新 2026/9/9 15:59:22

证据链

6 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。