拓冰建站拓冰建站
首页 / 资讯中心 / 正文

大模型商品10分类微调实战:从环境配置到 VLLM 部署全流程

一、简介目录一、简介二、环境配置1. 安装 GPU 环境​2. 安装 Python 环境​三、下载项目与数据1. 下载 LlamaFactory 并安装​2. 下载 ModelScope 多分类数据3. 下载模型​四、创建 Conda 环境进行微调1. 创建指定 Python 版本的 Conda 环境2. 安装项目依赖​3. 验证 CUDA 安装​4. 验证 LlamaFactory 安装​5. 验证本地模型6. 验证数据五、开始微调1. 修改数据配置​2. 调整参数3. 检查参数并开始微调4. 合并模型并验证结果六、VLLM 部署与性能优化1. 安装 WSL 环境2. 创建独立环境3. 安装环境和包4. 转发接口5. 性能对比七、总结本文基于 LlamaFactory 框架以 Qwen3-1.7B 模型为例完整演示大模型分类微调的实战流程。内容涵盖环境配置、数据准备、模型下载、Conda 环境搭建、参数调整、模型训练、结果评估以及 VLLM 部署优化帮助读者从零开始跑通一条完整的分类微调链路。二、环境配置1. 安装 GPU 环境在 CSDN 搜索「深度学习 GPU 环境安装Windows 安装 NVIDIA」按照教程完成 GPU 驱动和 CUDA 环境的安装。如果硬件条件有限也可以采用 CPU 方式进行微调。2. 安装 Python 环境在 CSDN 搜索「Python 环境搭建含库管理【超详细】」按照教程完成 Python 基础环境的安装与配置。三、下载项目与数据1. 下载 LlamaFactory 并安装使用 Git 克隆 LlamaFactory 项目到本地git clone --depth 1 https://github.com/hiyouga/LlamaFactory.git cd LlamaFactory-main2. 下载 ModelScope 多分类数据在 ModelScope 平台点击下载多分类数据集。下载完成后可以用智能体编写脚本进行数据类型转换第一步下载出来的数据是 jsonl 文件先转化为 xlsx 文件查看数据比例。第二步再转化为微调所需的 Alpaca 数据集格式。3. 下载模型进入 ModelScope点击「模型库」搜索 qwen3-1.7B下载模型。也可以直接使用命令行下载modelscope download --model Qwen/Qwen3-1.7B --local_dir F:\llm_practice\LlamaFactory\LlamaFactory-main\model\qwen3-1.7b四、创建 Conda 环境进行微调1. 创建指定 Python 版本的 Conda 环境进入 cmd 窗口执行以下命令创建环境conda create -n llamfactory_py313 python3.132. 安装项目依赖依次执行以下命令安装对应的包版本也可以使用 cu126 版本cd F:\llm_practice\LlamaFactory\LlamaFactory-main conda activate llamfactory_py313 pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu128 pip install jupyter -i https://pypi.tuna.tsinghua.edu.cn/simple pip install -e . -i https://pypi.tuna.tsinghua.edu.cn/simple pip install -r requirements/metrics.txt pip install bitsandbytes -i https://pypi.tuna.tsinghua.edu.cn/simple pip install scikit-learn -i https://pypi.tuna.tsinghua.edu.cn/simple3. 验证 CUDA 安装import torch x torch.tensor(1.0, devicecuda) print(x)4. 验证 LlamaFactory 安装llamafactory-cli webui成功执行后即可进入 LlamaFactory 页面。5. 验证本地模型确认 LlamaFactory 本地模型下载成功。在 LlamaFactory 页面填写相对路径点击「Chat」再点击「加载模型」模型加载成功即表示正常。6. 验证数据点击「Train」在「数据集」中查看数据集是否正常展示。五、开始微调1. 修改数据配置第一步把 Alpaca 微调数据放到 data 目录下。第二步编辑 dataset_info.json编辑数据集名称并保存。第三步在界面验证数据是否加载成功。2. 调整参数模型参数选择选择对应的语言。模型名称本次微调采用 Qwen3-1.7B-Base路径是 model 下的 qwen3-1.7b 路径。量化等级选择 8节省内存使用 QLoRA 量化。对话模板选择 qwen3。数据参数配置训练方式采用 SFT 监督微调。数据选择下载的 train.json。学习率选择 5e-5 到 2e-5 之间。训练轮次简单分类任务一般 3-10 轮即可。最大梯度范数主要用于裁剪梯度大于 1 容易梯度爆炸。最大样本数本次一轮约 1.5 万条数据默认 10 万无需修改。计算类型一般选择 fp16bf16 很多显卡不支持。阶段最大长度目测 input output instruction 长度不超过 500。批次大小需要根据显卡内存调整32G 显存可以先给 12。梯度累计累计几个批次更新一次梯度同样需要看内存。学习率调节短文本一般选择 cosine其他选项均有解释。其他参数设置日志间隔每训练 5 步写入一次日志。每间隔 100 次更新一次日志。预热暂给 0。勾选不学习历史对话。训练采用启动思考模式但推理不采用推理模式。额外参数配置这些参数默认即可微调分类模型不需要修改。3. 检查参数并开始微调第一步先预览命令检查参数是否正确。第二步点击开始训练。加速训练多卡情况下deepspeed 可以选择 2 或 3。后台显示训练中查看训练时长和当前训练 Loss本次训练约需 33 分钟。Loss 下降也可以去日志查看当前的 Loss。4. 合并模型并验证结果合并模型微调后的模型等于原模型加上 LoRA 参数。对比未微调的结果总准确率 59.6%。其中即饮茶的 444 条数据精准率为 0%效果很差软糖和硬糖也区分不了分别为 62% 和 48%口香糖、冷藏即饮果汁、即饮奶茶的召回率太低。微调后的结果随便用一个模型就可以写推理脚本结果总准确率提升到 91.3%。可以看到即饮茶已经微调过来了但还有部分召回率较低。Badcase 分析冷藏即饮果汁这块召回率还是比较低可以继续分析 badcase。可以看到是把冷藏即饮果汁识别成了非冷藏即饮果汁这种情况就需要用 VLOOKUP 去匹配训练集看是否有足够的样本训练。经过匹配筛选发现冷藏即饮果汁的训练集不够全175 条模型预测错误数据训练集仅匹配 5 条。所以需要加入足够的训练集再继续训练一遍。六、VLLM 部署与性能优化1. 安装 WSL 环境wsl --install关机重启后启动 WSL。2. 创建独立环境查看系统信息uname -a cat /etc/os-release进入初始文件路径并安装 Minicondacd ~ wget https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh bash Miniconda3-latest-Linux-x86_64.sh一路回车输入 yes再输入 exit再手动输入命令source ~/miniconda3/etc/profile.d/conda.sh conda --version3. 安装环境和包安装环境conda create -n vllm_5090 python3.12 -y conda activate vllm_5090 conda install -c nvidia cuda-toolkit12.9 -y export PATH$CONDA_PREFIX/bin:$PATH hash -r pip install vllm0.1.0 -i https://pypi.tuna.tsinghua.edu.cn/simple export VLLM_USE_FLASHINFER_SAMPLER04. 转发接口python -m vllm.entrypoints.openai.api_server \ --model /mnt/f/llm_file/Qwen3-1.7B \ --host 0.0.0.0 \ --port 8000 \ --max-model-len 512 \ --dtype bfloat16 \ --enforce-eager5. 性能对比普通跑批时间需要 54 秒VLLM 跑批只需要 22 秒性能提升明显。七、总结本文完整演示了基于 LlamaFactory 的大模型分类微调流程。从环境配置、数据准备、模型下载到 Conda 环境搭建、参数调整、模型训练与评估再到 VLLM 部署优化形成了一条完整的实战链路。通过微调模型总准确率从 59.6% 提升到 91.3%并通过 Badcase 分析定位了训练数据不足,不全面的问题。最后通过 VLLM 部署将推理性能提升了约 2.5 倍。当然还可以用fastapivllm进一步优化性能,下篇再详细说明性能优化。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门