英特尔为 MiniMax H3 提供 Day 0 支持,实现多卡 GPU 部署方案

英特尔:为开源多模态视频模型 MiniMax H3 提供 Day 0 支持,实现基于多卡 GPU 的部署方案

精选理由

英特尔把 MiniMax H3 跑在多卡 GPU 上,锐炫 Pro B70 首发支持,还搞了 2TP×4USP 混合并行,视频生成部署有参考了。

AI 摘要

英特尔今日宣布为开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持,锐炫 Pro B70 已率先完成适配。团队实现多卡 GPU 部署方案,Encoder 采用 8 卡张量并行,DiT 采用 8 卡 USP 并结合 Layer-wise Offloading,VAE 部署于 B70 GPU。相比纯 8 卡 USP,新方案还开发了 2TP×4USP 混合并行,将 USP 并行度降至 4 并引入 2 路张量并行,以减少通信开销。该方案还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等算子进行持续优化。

原文 · IT之家

英特尔:为开源多模态视频模型 MiniMax H3 提供 Day 0 支持,实现基于多卡 GPU 的部署方案

IT之家 8 月 3 日消息,英特尔今日宣布,为新一代开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持。 据介绍,英特尔锐炫 Pro B70 第一时间完成对 MiniMax H3 的适配,英特尔团队 实现了一种基于多卡 GPU 的部署方案 。该方案采用 Encoder 8 卡张量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并结合 Layer-wise Offloading),以及 VAE 部署于 B70 GPU 的整体架构, 实现了视频生成全流程的 GPU 加速 。 其中,Encoder 采用 8 卡张量并行完成文本编码;作为推理过程中计算量最大的模块,DiT 采用 8 卡 USP 并结合 Layer-wise Offloading 技术,使模型参数按层动态加载到 GPU,在突破单卡显存限制、降低模型常驻显存需求的同时,支持更大规模 DiT 模型的部署;VAE 则部署于 B70 GPU 上完成最终的视频解码。该方案兼顾了模型容量与计算效率,为大规模视频生成模型提供了更具扩展性的部署方式。 在此基础上,团队进一步结合张量并行(Tensor Parallel,TP)与 USP 的优势,开发了 2TP×4USP 的混合并行方案。 相较于纯 8 卡 USP,该方案将 USP 并行度由 8 降至 4,并引入 2 路张量并行对计算进行协同加速 ,在保持模型扩展能力的同时,减少 USP 带来的通信开销,实现计算负载与通信开销之间更优的平衡,从而进一步提升整体推理性能。 IT之家获悉,团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升 GPU 的计算效率,持续降低端到端推理时延,取得了良好的优化效果。 相关阅读: 《 通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率 》