ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

129、MLIR的Schedule(调度)与Parallelism(并行性)

129、MLIR的Schedule(调度)与Parallelism(并行性) MLIR的Schedule(调度)与Parallelism(并行性)从一次GPU利用率惨案说起去年调一个AI编译器后端,跑ResNet-50推理,NVIDIA Nsight Systems一抓,GPU利用率只有23%。代码逻辑看着没问题,算子都正确lower到了LLVM GPU dialect,但就是跑不满。折腾三天,最后发现是MLIR的schedule没写好——循环分块后的并行维度没正确映射到GPU线程块,导致大量线程空转。那会儿真想抽自己,明明MLIR的parallelism机制就在那儿摆着,愣是没用好。这个教训让我意识到,MLIR的Schedule不是简单的“调度顺序”,它直接决定了并行性能否被有效提取和映射到目标硬件。今天这篇笔记,就聊聊我在这块踩过的坑和总结的经验。Schedule的本质:不是“先做A后做B”很多人把MLIR的Schedule理解成“先执行这个pass,再执行那个pass”,这是典型的误解。Schedule在MLIR里,核心是对IR中循环和计算结构的重组,目的是暴露并行机会。看一个实际例子。假设我们有这样的循环嵌套:scf.for %i = 0 to 1024 { scf.for %j = 0 to 1024 { %val = load %A[%i, %j] %res = addf %val, %cst store
返回列表