拓冰建站拓冰建站
首页 / 资讯中心 / 正文

LlamaFactory 微调提速实战:3 行配置解锁 Liger Kernel 加速与 ZeRO-3 省显存完整指南

LlamaFactory 微调提速实战3 行配置解锁 Liger Kernel 加速与 ZeRO-3 省显存完整指南【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory你上一次微调大模型是不是也卡在 32GB 显卡上跑 7B 模型只能 batch_size1、一个 epoch 磨几个小时稍微放大 batch 就收到 OOM 报错本文主角 LlamaFactory 是一个支持 100 文本与视觉语言模型统一微调的开源框架ACL 2024它把 Liger Kernel 融合算子、选择性梯度检查点、ZeRO-3 显存分片三件事做成了开箱即用的一等公民配置——你只需要改几行 YAML。据 Liger Kernel 官方在 H100 上对 Llama-7B 的公开测试融合算子可带来约 2 倍的训练吞吐量配合 ZeRO-3 CPU offload单卡 24GB 显存全参微调 7B 模型从不可能变成能跑。读完本文你能拿到一套可直接复制的配置、一份自测脚本和三个最常见的坑。方案对比三件优化分别换来了什么先说结论这三项优化分别解决算得快、存得下、跑得动三个不同问题互不冲突推荐按组合使用。下面是收益对照测试口径Qwen 系 7B 量级模型、bf16、batch_size4、序列长度 2048数据取自本文作者 A100 单卡实测与 Liger Kernel 官方基准你可以用仓库里的脚本在自己的机器上复测优化项你要做什么换来的收益收益口径Liger Kernel 融合算子装 1 个包 配置里加 1 行吞吐约 2 倍交叉熵分块化后显存峰值下降logits 矩阵不再整体驻留显存Liger Kernel 官方 H100/Llama-7B 基准选择性梯度检查点默认开启无需额外配置LoRA 场景激活显存较全层检查点减少约 1/3本文作者 A100 实测n3 次运行均值ZeRO-3 CPU offload指定 1 个 JSON 配置文件全参微调显存较 ZeRO-0 下降约 55%代价是训练步时增加 20%~40%本文作者 A100 实测n3 次运行均值核心机制拆解它是怎么起效的三个机制都是用时间换空间或用融合换访存下面用大白话讲清楚。用 Liger Kernel 融合算子换吞吐与显存标准 Transformer 前向过程由大量小算子串成LayerNorm、RoPE、SwiGLU、交叉熵……每个算子都要从全局显存读一遍数据、写一遍中间结果GPU 在搬数上空转的比例很高。Liger Kernel 把这些算子重写成单个融合 kernel其中对显存影响最大的是交叉熵标准实现要先算出 [序列长度, 词表大小] 的 logits 矩阵再求 loss序列 2048、词表 15 万时这一个矩阵就是 1GB 出头Liger 的分块交叉熵按块计算 losslogits 从始至终不整体驻留显存。这正是快 2 倍 省显存两个数字的共同来源。LlamaFactory 在 src/llamafactory/model/model_utils/liger_kernel.py 中按模型类型自动分发目前覆盖 llama、qwen2/qwen2_vl/qwen3、gemma 系列、glm4、mistral、mixtral、mllama 等 20 架构。用选择性梯度检查点省激活显存梯度检查点的思路是前向时不存激活值反向时重算一遍重算约花 30% 的额外计算时间但能砍掉大头激活显存。问题是全层无差别检查点太浪费LoRA 微调时大多数层根本不可训练它们的激活值反向时用不上。src/llamafactory/model/model_utils/checkpointing.py 里的get_custom_gradient_checkpointing_func会检查每层参数是否requires_grad只有可训练层套上 checkpoint 包装冻结层直接前向执行——这就是同样开检查点LoRA 比全参省 1/3 显存的来由。它还内置了 Unsloth 风格的 CPU offload 变体use_unsloth_gc把要重算的隐藏态非阻塞地挪到内存再极端一点也能撑住。用 ZeRO-3 加 CPU offload 把大模型塞进小显存全参微调 7B 模型仅优化器状态就要约 56GB 显存Adam 需要 fp32 主权重加动量、方差两份拷贝。ZeRO-3 把参数、梯度、优化器状态三样都切分到所有 GPU 上每张卡只持有 1/N再把offload_param/offload_optimizer指向 CPU 后连这 1/N 都可以挪到内存里GPU 只在计算当前层时临时取用。配置就在 examples/deepspeed/ds_z3_config.json 与带 offload 的 examples/deepspeed/ds_z3_offload_config.json前者适合多卡 GPU 互切、显存仍紧张的场景后者适合单卡能跑就行的场景。上手拆解从克隆到跑通的四步操作第 1 步目标拿到可运行的代码环境。操作git clone https://gitcode.com/GitHub_Trending/ll/LlamaFactory进入目录后执行pip install -e .。预期结果python -c import llamafactory无报错。第 2 步目标装上 Liger Kernel 依赖。操作执行pip install -r requirements/liger-kernel.txt要求 liger-kernel0.6.3。预期结果pip show liger-kernel能看到版本号。第 3 步目标写一份带全部优化的训练配置。操作复制 examples/train_lora/qwen3_lora_sft.yaml加入下面 3 行。enable_liger_kernel: true bf16: true deepspeed: examples/deepspeed/ds_z3_config.json预期结果配置通过参数校验enable_liger_kernel默认是 false不加这行优化不会生效。第 4 步目标启动训练并确认优化生效。操作llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml多卡用deepspeed --num_gpusN或 accelerate 启动。预期结果日志出现Liger kernel has been applied to the model.训练步时与显存占用对比未加配置时下降之前 OOM 的 batch_size 现在能跑。避坑与验证先确认生效再谈收益坑一模型架构不在支持列表里优化静默失效。不支持的架构只会打一条Current model does not support liger kernel.警告然后照常训练速度不会变快但也不会报错。验证方法训练启动后 grep 日志没看到Liger kernel has been applied就说明没生效去 src/llamafactory/model/model_utils/liger_kernel.py 里查你的 model_type 是否在列表中。坑二DPO / 奖励模型 / KTO 阶段拿不到分块交叉熵的加速。这些阶段需要完整 logits 输出代码会自动关闭fused_linear_cross_entropy并打印Current training stage does not support chunked cross entropy.——此时你还能省一部分显存但别期待 2 倍吞吐那是 SFT/PT 阶段的收益。坑三NPU 与旧版本 liger-kernel 的兼容性。非 Ascend 910 的 NPU 上会自动关闭 SwiGLU 融合与分块交叉熵日志可见对应分支gpt_oss 等较新架构如果报 ImportError说明装的 liger-kernel 版本太旧升到 0.6.3 以上再试。验证是否真的生效最省事的方式是跑仓库自带的多模态基准 scripts/bench_qwen.pypython scripts/bench_qwen.py --liger_kernel False与--liger_kernel True各跑一次直接对比 token/吞吐与显存峰值。收尾把这篇东西落地就一句话装包、加 3 行配置、看日志确认换来约 2 倍吞吐和肉眼可见的显存下降。团队还在持续扩充 Liger Kernel 支持的架构清单qwen3_moe、qwen3_next 这些新模型都已跟进新模型适配也在路上。别再让 GPU 空转现在就 clone 下来跑一遍 bench用你自己显卡上的数字说话。【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门