【华为昇腾服务器使用docker部署大模型方案】
华为昇腾服务器使用docker部署大模型方案背景描述服务器配置常见问题背景描述市面上使用的高级大模型都有资费或者涉及公司业务的话就不太方便所以这次有机会可以在本地基于服务器搭建大模型搭建前具备基础的硬件知识linux命令docker等服务器配置使用的麒麟系统华为昇腾910B两块显卡每块32G用显卡跑大模型最好5-6个SSD硬盘总内存8-9T运行内存250G安装显卡驱动 去华为昇腾官网根据型号系统版本下载驱动CANN版本最好下最新的我这边安装驱动时安装了不下3-5次因为在启动昇腾官网的大模型镜像时需要使用设备的显卡每次服务器重启后卡在40%或者0%查了很多资料问过其他大模型博客客服给的答案是CANN版本有可能低反正最后也没用【昇腾官网镜像】只是借鉴了部分参数如设备映射。docker我用docker-compose部署一开始只是用docker一步步搭建每个容器后面全部建好后再统一版本使用docker-compose可以清晰管理容器的版本信息关联信息镜像如下【quay.io/ascend/vllm-ascend:v0.18.0-openeuler 运行大模型的镜像大模型单独下载NPU加载】【ollama/ollama:latest因显卡不够向量模型和排序模型直接在ollama里下载用CPU加载】【qdrant/qdrant:latest 向量数据库】【ghcr.nju.edu.cn/open-webui/open-webui:main 大模型可视化平台可管理访问大模型】3.大模型搭建思路先把大模型下载出来通过容器映射大模型的目录显卡目录再使用VLLM框架运行大模型也就是镜像容器【quay.io/ascend/vllm-ascend:v0.18.0-openeuler】如果不知道怎么下载大模型可以先用官网镜像操作步骤启动容器启动时会自行拉取对应镜像的大模型4.docker重要命令解析自启【restart】设备映射【devices】目录映射【volumes】端口映射【ports】容器互相共用的网络【networks】容器运行环境【runtime】容器内环境【environment】运行命令【command】操作命令中有几个命令参数要注意【–safetensors-load-strategy eager】【–enable-auto-tool-choice】【–tool-call-parser hermes】第一个参数可以让你的大模型成功加载不会卡主第二三个参数可以让大模型可以正常会话且允许调用其他工具如大模型容器启动配置文件示例图openwebui容器示例图openwebui界面配置示例图可连接大模型配置角色账号提供接口秘钥访问大模型管理示例图可以统一管理ollama的大模型及其他大模型管理账号API秘钥示例图常见问题一、服务器启动后容器没启动答容器有延时启动因会话大模型要使用显卡NPU加载服务器启动后大约20-60S二、docker启动了大模型的容器启动失败其他都成功启动答需要给docker容器配置延时启动因为大模型需要npu显卡启动显卡在电脑开机时还没加载完就启动大模型当然会失败三、大模型接口访问不了答检查服务器IP地址是否变更如果间接通过openwebui访问的会话模型请查询openwebui的openapi的访问地址是否与服务器地址一致API秘钥是否正确以上只是作者在本地搭建部署后提供的一个方案以及遇到问题的解决思路没有描述详细的操作每一步需要自己实际操作。