IT之家 8 月 3 日消息,英特尔今日宣布,为新一代开源多模态视频模型 MiniMax H3 提供 Day 0首发支持。
据介绍,英特尔锐炫 Pro B70 第一时间完成对 MiniMax H3 的适配,英特尔团队实现了一种基于多卡 GPU 的部署方案。该方案采用 Encoder 8 卡张量并行(8TP)、DiT 8 卡 USP(Ulysses Sequence Parallel,并结合 Layer-wise Offloading),以及 VAE 部署于 B70 GPU 的整体架构,实现了视频生成全流程的 GPU 加速。
其中,Encoder 采用 8 卡张量并行完成文本编码;作为推理过程中计算量最大的模块,DiT 采用 8 卡 USP 并结合 Layer-wise Offloading 技术,使模型参数按层动态加载到 GPU,在突破单卡显存限制、降低模型常驻显存需求的同时,支持更大规模 DiT 模型的部署;VAE 则部署于 B70 GPU 上完成最终的视频解码。该方案兼顾了模型容量与计算效率,为大规模视频生成模型提供了更具扩展性的部署方式。
在此基础上,团队进一步结合张量并行(Tensor Parallel,TP)与 USP 的优势,开发了 2TP×4USP 的混合并行方案。相较于纯 8 卡 USP,该方案将 USP 并行度由 8 降至 4,并引入 2 路张量并行对计算进行协同加速,在保持模型扩展能力的同时,减少 USP 带来的通信开销,实现计算负载与通信开销之间更优的平衡,从而进一步提升整体推理性能。
IT之家获悉,团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化,对矩阵乘法、注意力等关键算子进行了持续优化,进一步提升 GPU 的计算效率,持续降低端到端推理时延,取得了良好的优化效果。