拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Nemotron 3 Super 120B量化剖析:Model Optimizer超大模型压缩工作流

Nemotron 3 Super 120B量化剖析Model Optimizer超大模型压缩工作流【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-OptimizerNemotron 3 Super 120B120B 总参数、每 token 仅激活 12B 的 Mamba-MoE 混合架构是典型的大参数量、高显存占用模型。本文剖析 Model Optimizer 官方为它设计的量化压缩工作流如何用 NVFP4 FP8 混合精度配方把约 240GB 的 BF16 权重压缩一半以上再一键导出到 vLLM / TensorRT-LLM / SGLang 部署帮助新手理解超大模型量化、推理加速的完整链路。为什么 Nemotron 3 Super 120B 必须压缩Nemotron 3 Super 120B-A12B 是 MoE 架构总参数 120B每个 token 只激活 12B。BF16 原始权重大约 240GB单节点放不下部署成本极高。Model Optimizer 官方已经将量化后的检查点开源FP8 与 NVFP4 两个版本并完整公开了背后的量化配方与脚本这正是本文要剖析的工作流压缩格式权重精度相对 BF16 体积典型收益BF16原始16 bit100%基准FP88 bit≈50%显存减半、吞吐提升NVFP4 混合精度4/8 bit 混合≈35%进一步压缩 MoE 专家权重量化方案剖析Mamba-MoE 的分层混合精度设计超大模型量化最大的坑是一刀切——把所有层都压到 4 bit 会导致精度崩塌。官方配方 nvfp4-mse.yaml 采用了按组件精细分配精度的混合方案这也是 Model Optimizer 混合精度量化的典型思路模型组件量化精度说明MoE 路由专家routed expertsNVFP4 W4A4block 16e4m3 静态 scale占参数大头压缩收益最高MoE 共享专家shared expertsFP8 per-tensor兼顾精度与压缩Mambain_proj/out_projFP8 per-tensor状态空间投影KV CacheFP8降低长上下文显存Attention q/k/v、lm_head、MTP 头、Latent-MoEBF16不量化精度敏感层保持原样核心逻辑压缩收益最大、精度风险最低的专家层压到 4 bit敏感的注意力与输出层保持 BF16。同一份层映射还提供了 nvfp4-max-calib.yamlmax 校准版用于对比实验。两种校准算法MSE 搜索 vs Max 校准量化精度由校准决定。两份配方唯一的区别在校准算法详见 modelopt_recipes/ptq.mdnvfp4-mse与官方发布检查点一致权重 scale 用MSE 最小均方误差搜索选出并对 FP8 scale 在 128 个 e4m3 候选值上做扫描fp8_scale_sweep: true比直接取最大值amax更精细精度更好但耗时略高。nvfp4-max-calib对照组同一份层映射改用经典的max/amax 校准适合快速基线对比。如果不想手写配方Model Optimizer 还提供AutoQuantize自动搜索自动为每一层挑选 NVFP4 / FP8 / BF16 精度组合在给定有效比特数预算下逼近 BF16 精度工作流一Hugging Face 脚本量化推荐入门入口脚本是 examples/hf_ptq/hf_ptq.py配合 examples/hf_ptq/README.md 即可上手。关键步骤加载模型 校准默认混合使用 128~512 条样本做校准cnn_dailymail Nemotron 后训练数据集无需重训练指定 recipe用--recipe传入上面的配方名一步声明量化算法 层映射 KV cache 策略导出统一检查点export_hf_checkpoint生成与 HuggingFace 结构对齐的检查点三大推理框架通用。对于 Nemotron 3 Super 这种 120B 级别的模型单节点显存不够怎么办官方提供了多机 FSDP2 分布式 PTQ的现成脚本 examples/hf_ptq/slurm/multinode_fsdp2_ptq.slurm默认任务就是把 Nemotron-3-Super 量化到 NVFP4sbatch --nodes2 slurm/multinode_fsdp2_ptq.slurmFSDP2 把模型切片到多台 GPU 上完成校准与导出是超大模型压缩工作流里最省心的一条路。若需 clone 仓库仓库地址为 https://gitcode.com/GitHub_Trending/te/Model-Optimizer 。工作流二Megatron-Bridge 量化 导出训练级场景如果量化后还要继续做 QAD量化感知蒸馏微调推荐走 Megatron-Bridge 两步流程见 examples/megatron_bridge/README.md量化examples/megatron_bridge/quantize.py 在 Megatron 分布式TP/PP/EP下做 PTQ 校准保存带 ModelOpt 状态的 Megatron 检查点可继续加载训练导出examples/megatron_bridge/export_quantized_megatron_to_hf.py 将其转换为可直接部署的统一 HF 检查点。仓库还内置了该模型的端到端 launcher 任务例如 megatron_lm_ptq.yaml 一键完成量化 导出 vLLM 冒烟测试1 节点 4 卡以及投机解码评测任务 specdec_bench_mtp_vllm.yaml可直接参考其参数组织方式。部署统一检查点直通三大推理框架量化导出后的统一 HF 检查点无需任何转换即可在 TensorRT-LLMPyTorch 与 C 后端、vLLM、SGLang 上部署。Nemotron 3 Super 120B 的 FP8 与 NVFP4 两个版本在官方支持矩阵中均已全绿 ✅见 docs/source/deployment/3_unified_hf.rst。底层能力均来自 Model Optimizer 核心模块量化算法与校准modelopt/torch/quantization/统一检查点导出modelopt/torch/export/内置量化配方库modelopt_recipes/精度回补QAD 量化感知蒸馏如果 NVFP4 量化后精度仍不达标最后的大招是QADQuantization Aware Distillation以原始 BF16 模型为教师对量化模型做蒸馏微调把量化损失学回来。官方提供了端到端的 W4A4 NVFP4 QAD 教程Nemotron 系列的完整工作流参考 examples/megatron_bridge/tutorials/下图展示了 QAD 过程中量化损失随训练步数收敛的曲线小结一套可复用的超大模型压缩清单先看架构定精度MoE 专家层压 NVFP4敏感层保留 BF16KV cache 用 FP8校准确认精度MSE 搜索精度更高配fp8_scale_sweepmax 校准更快显存放不下就分布式Slurm FSDP2 多机 PTQ 是 120B 级模型的标准操作导出即部署统一 HF 检查点直通 vLLM / TensorRT-LLM / SGLang不达标再上 QAD蒸馏微调回补精度。掌握这条工作流后你可以把它平移到 Qwen、DeepSeek、Llama 等任意超大 MoE 模型上——这正是 Model Optimizer 统一压缩库的价值所在。【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-Optimizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门