拓冰建站拓冰建站
首页 / 资讯中心 / 正文

129、MLIR的Schedule(调度)与Parallelism(并行性)

MLIR的Schedule(调度)与Parallelism(并行性)从一次GPU利用率惨案说起去年调一个AI编译器后端,跑ResNet-50推理,NVIDIA Nsight Systems一抓,GPU利用率只有23%。代码逻辑看着没问题,算子都正确lower到了LLVM GPU dialect,但就是跑不满。折腾三天,最后发现是MLIR的schedule没写好——循环分块后的并行维度没正确映射到GPU线程块,导致大量线程空转。那会儿真想抽自己,明明MLIR的parallelism机制就在那儿摆着,愣是没用好。这个教训让我意识到,MLIR的Schedule不是简单的“调度顺序”,它直接决定了并行性能否被有效提取和映射到目标硬件。今天这篇笔记,就聊聊我在这块踩过的坑和总结的经验。Schedule的本质:不是“先做A后做B”很多人把MLIR的Schedule理解成“先执行这个pass,再执行那个pass”,这是典型的误解。Schedule在MLIR里,核心是对IR中循环和计算结构的重组,目的是暴露并行机会。看一个实际例子。假设我们有这样的循环嵌套:scf.for %i = 0 to 1024 { scf.for %j = 0 to 1024 { %val = load %A[%i, %j] %res = addf %val, %cst store
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门