拓冰建站拓冰建站
首页 / 资讯中心 / 正文

INT8 量化如何避免回退 CPU:MiniMax-H3-Comfy-NPU 的 npu_quant_matmul 内核实现完整剖析

INT8 量化如何避免回退 CPUMiniMax-H3-Comfy-NPU 的 npu_quant_matmul 内核实现完整剖析【免费下载链接】MiniMax-H3-Comfy-NPU项目地址: https://ai.gitcode.com/Ascend-SACT/MiniMax-H3-Comfy-NPU在昇腾 NPU 上跑 MiniMax-H3 的 INT8 量化权重时最大的隐性陷阱就是「量化矩阵乘法悄悄回退到 CPU」。本项目MiniMax-H3-Comfy-NPU是一个 ComfyUI 昇腾多卡适配补丁核心手段就是把 INT8 Linear 统一改派到npu_quant_matmul硬件算子上从根源上阻断 CPU 回退路径让 4 卡 768P 推理端到端耗时直接减半。一、为什么 INT8 量化在 NPU 上容易变慢很多人以为「用了 INT8 权重 自动更快」但在 ComfyUI 里事情并不这么简单ComfyUI 的量化 Linear 默认走 Comfy Kitchen 的 CUDA 内核路径底层是torch._int_mmtorch._int_mm是 CUDA 的 eager 内核在昇腾上 torch-npu 的处理方式是把整个算子搬到 CPU 执行单卡时它是「极慢」多卡时更糟——它还会阻塞所有 HCCL 通信 rank等于拖住整组 NPU补丁作者在 comfy-ui-changes.patch 中的注释直说了这一点“torch-npu moves it to the CPU, which is both extremely slow and blocks every HCCL rank.”这就是本项目要解决的核心问题如何让 INT8 权重真正跑在 NPU 的量化矩阵乘法上。二、npu_quant_matmul 的三步分派逻辑补丁在comfy/ops.py中新增了三个协作函数见 comfy-ui-changes.patch形成「识别 → 校验 → 执行」的完整链路1. 识别这是不是 NPU INT8 场景_is_npu_int8_linear同时检查四个条件comfy.model_management.is_ascend_npu()为真输入张量在npu设备上权重是QuantizedTensor量化布局为TensorWiseINT8Layout张量级 INT8每行一个 scale2. 校验硬件算子能不能吃下这个形状_can_use_npu_int8_linear做了一组严格的「算子准入检查」任何一条不满足就放弃硬路径校验项要求输入精度float16或bfloat16权重非转置布局、非空张量特征维度必须是 16 的倍数input_features % 16 0scale 形状1 个全张量或与输出行数一致SwiGLU 激活特征维必须是偶数这些限制正是昇腾npu_quant_matmul算子对输入对齐的真实要求——提前在 Python 层筛掉避免运行期报算子错误。3. 执行一次调用完成量化矩阵乘法_npu_int8_linear的核心流程只有四步取出 INT8 权重量化数据与weight_scalefp32若权重带 ConvRotHadamard 旋转标记先用_rotate_activation对激活做旋转激活按行动态量化成 int8得到pertoken_scale逐 token scale调用torch_npu.npu_quant_matmul(input_qdata, qdata.t(), weight_scale, pertoken_scale..., output_dtype...)一步完成 INT8×INT8→BF16 的矩阵乘法bias 在设备侧直接累加关键调用见 comfy-ui-changes.patch。整条路径不产生任何 CPU 驻留的 GEMM。三、兜底策略宁可设备侧浮点 GEMM也不回退 CPU ️这是本实现最「反直觉」也最关键的设计——_npu_int8_linear_or_dequant若满足硬件条件 → 走npu_quant_matmul硬路径若不满足形状不对齐等罕见场景→把权重反量化回浮点直接在 NPU 上做普通F.linear补丁注释解释了取舍不支持的形状很少见此时一次设备侧浮点 GEMM 远比把整个张量拉到 CPU 划算。配套的单元测试在 tests/test_npu_quant_ops.py 中锁死了这一行为保证「永远不回退 CPU」。四、多卡进阶rank 间共享动态量化 scale多 NPU 张量并行文本编码器 Qwen3-VL TP下每行输入的动态 scale 必须在所有 rank 之间保持一致否则各卡量化口径不同、AllGather 拼出来的结果是错的。linear_tp_row见 comfy-ui-changes.patch的做法每个 rank 先本地算出abs().amax(dim-1)通过tp_context.all_reduce_max底层走 comfy/multinpu.py 中的 HCCL 集合通信取全局最大值除以 127 得到共享input_scale各 rank 用同一把「尺子」量化后调用npu_quant_matmul这样既保住了量化精度scale 全 rank 一致又让通信与计算路径全部留在 NPU 侧。五、实测收益INT8 量化带来的真实提速 ⚡以下数据来自 README.md 官方基准4 NPU、768P、固定 seed场景权重输出端到端耗时FL2VA Turbo 8 步BF16768P / 5 秒212.33 sFL2VA Turbo 8 步INT8768P / 5 秒113.51 s约 -47%FL2VA Turbo 8 步BF16768P / 15 秒441.32 sFL2VA Turbo 8 步INT8768P / 15 秒389.37 sFL2VA Turbo 8 步单卡INT8480P / 15 秒370.99 s单卡低显存方案官方也明确推荐 INT8 量化权重——没有npu_quant_matmul这条硬路径单卡 INT8 根本不可用。六、快速上手清单按 README.md 准备 CANN 9.0.1 torch-npu 2.10.0.post2 环境执行 install_deps_minimax_h3.sh 复制自定义节点 ComfyUI-MiniMax-H3-Turbo 与工作流应用核心补丁git apply comfy-ui-changes.patch必须先--check下载 INT8 量化权重如minimax_h3_fl2va_int8_convrot.safetensors放入模型目录用 restart-v1.sh 启动打开 fl2va_8steps_lora.json 工作流即可出图总结一句话回顾本项目的量化设计哲学硬路径优先、设备侧兜底、多卡共享 scale。npu_quant_matmul不是简单换个 API 调用而是配套了准入校验、ConvRot 旋转、HCCL scale 同步和永不回退 CPU 的兜底策略才把 INT8 量化从「可能变慢的坑」变成了「稳定提速一倍的工具」。【免费下载链接】MiniMax-H3-Comfy-NPU项目地址: https://ai.gitcode.com/Ascend-SACT/MiniMax-H3-Comfy-NPU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门