Modal 推出 GPU Glossary 术语手册,按四层拆解 GPU 技术栈
Modal 出了一份免费 GPU 术语手册,从 CUDA 执行模型到性能调优一条链讲清楚,想搞懂 GPU 编程的可以当教材啃
Modal 上线的 GPU Glossary 把 GPU 技术栈拆成四个章节:设备硬件、设备软件(CUDA 执行模型)、主机软件(驱动与工具链)、性能分析。手册从 CUDA 的三重含义切入,解释 GPU 用海量线程隐藏延迟的机制,以及线程-内存-硬件三层同构的编程逻辑。性能分析部分给出完整诊断链,从定位瓶颈、roofline 分析到用 Little 定律计算并发。词条间密集交叉链接,支持按需查阅或线性通读。
Modal @modal 这份「GPU 术语手册」做的太友好了,它把整个 GPU 技术栈拆成四个相互勾连的层面:设备硬件、设备软件(执行模型)、主机软件(驱动与工具链)、性能分析,每个词条都密集交叉链接,既可以按需查阅单个术语,也可以从头到尾线性通读。 理解这份手册从「CUDA」开始,CUDA 有三重含义:一种设备架构、一个并行编程模型、一个软件平台。这份手册的四个章节恰好分别展开这三个含义加上性能分析。 GPU Glossary 四个章节: 1. 设备硬件:GPU 的物理解剖 - CPU 用复杂核心避免延迟,GPU 用海量简单线程隐藏延迟 2. 设备软件:CUDA 的执行模型 - 线程层级、内存层级、硬件三层严格同构,程序员亲手管理内存 3. 主机软件:驱动、工具链与库 - Runtime 包着 Driver,闭源库拿来即用,CUTLASS 一系负责构造自己的 kernel 4. 性能分析:完整诊断链 - 定瓶颈 → roofline 定性 → 利用率定位 → warp 机制 → 访存模式 → 资源约束 这三句总结很到位 GPU 的本质是“单周期切换海量简单线程来隐藏延迟”;编程的本质是“沿线程-内存-硬件的同构层级,把数据在正确的层级间搬运,把算术强度做到岭点以上”;性能工程的本质是“沿诊断链逐层定位,用 Little 定律算够并发,不为中间指标(如占用率)本身而优化。 modal.com/gpu-glossary 💬 0 🔄 0 ❤️ 5 👀 364 📊 2 ⚡