拓冰建站拓冰建站
首页 / 资讯中心 / 正文

跑通DeepSpeed Windows原生部署:单卡训练、微调、推理从0到1

跑通DeepSpeed Windows原生部署单卡训练、微调、推理从0到1【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeedDeepSpeed 是微软开源的深度学习优化库ZeRO 显存优化和 3D 并行是它的招牌。本文解决一件事Windows 用户如何从零安装 DeepSpeed跑通单卡训练、微调与推理。照做约 15 分钟完成部署可覆盖 95% 的核心训练与推理能力。Windows 上 DeepSpeed 环境自检4 个检查项先过一遍Windows 原生支持从 0.14.5 版本开始。官方实测环境是一台 Surface Laptop Studio 2Windows 11 23H2构建号 22631.3880单块 4GB 显存的 RTX A2000配 PyTorch 2.3.0。你的机器先对照下表确认检查项建议值怎么确认Windows11 23H2 及以上运行winver查看版本Python3.10 – 3.11python --versionPyTorch2.3.0 CUDA 版python -c import torch; print(torch.__version__, torch.version.cuda)GPU 驱动支持 CUDA 的 NVIDIA 显卡nvidia-smi能看到显卡与 CUDA 版本几个定位问题时会用到的仓库文件官方 Windows 实践博客blogs/windows/08-2024/chinese/README.mdWindows 专用编译脚本build_win.batWindows 打包清单决定 wheel 里带什么MANIFEST_win.in运行时依赖声明requirements/requirements.txt在 Windows 上安装 DeepSpeed 的完整命令主路径一条命令pip install deepspeed✅ 关键点与 Linux 不同Windows 的 pip 包内置了全部预编译算子你不需要安装 CUDA SDK 或 C 编译器。装完直接验证ds_report 预期输出里CUDA一行显示 enabled算子列表中各 op 状态可用。如果你需要基于最新源码构建自己的 wheel或跟进新算子可以改走源码方式克隆仓库后执行 build_win.bat它会自动设置CUDA_HOME、关闭 AIO/CUTLASS/SparseAttention 等 Windows 暂不支持的算子开关再运行python -m build --wheelgit clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed .\build_win.bat单卡跑通 DeepSpeed 训练、微调、推理三步验证以下示例脚本来自 DeepSpeedExamples 仓库官方示例库名称如此克隆后进入对应目录执行覆盖训练、微调、推理三个递进场景全程只用 4GB 显存。场景一CIFAR-10 单卡预训练deepspeed cifar10_deepspeed.py --deepspeed预期看到训练循环正常滚过若干 epochloss 逐轮下降。实测指标RTX A2000 4GB 上 5 个 epoch 约 8 分钟跑完测试精度约 89.3%。场景二LoRA 微调 OPT-125MZeRO-2 CPU Offloaddeepspeed training\step1_supervised_finetuning\main.py --model_name_or_path facebook/opt-125m --gradient_accumulation_steps 8 --lora_dim 128 --only_optimize_lora --print_loss --zero_stage 2 --deepspeed --dtype bf16 --offload --output_dir output预期看到每一步打印 loss 值并持续下降结束后权重写入output目录。这条命令同时验证了三个能力HuggingFace Transformers 集成、LoRA、CPU Offload。⚠️ 显存峰值始终压住 4GB 上限bf16 offload 缺一不可。场景三ZeRO-Inference 跑 Llama-2-7B4GB 显存放不下模型加生成工作集ZeRO-Inference 把权重卸载到 CPU 内存deepspeed run_model.py --model meta-llama/Llama-2-7b-hf --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload预期看到每条 8 token 的提示词生成 32 token 结果并打印。实测指标单条生成 32 token 约 47 秒显存占用峰值 3.8GB。DeepSpeed Windows 高频报错速查表报错特征根因一句话修复动作cl.exe not found源码编译需要 MSVC 工具链而没装安装 Visual Studio Build Tools 勾选使用 C 的桌面开发改用开发者命令提示符CUDA error: no kernel image is availablePyTorch 的 CUDA 版本与驱动不匹配pip install torch2.3.0cu121 -f https://download.pytorch.org/whl/torch_stable.html重装 PyTorchAccess is deniedPowerShell 权限不足以管理员身份重新打开 PowerShell 再执行ds_report中 CUDA 显示 disabled装成了 PyTorch CPU 版python -c import torch; print(torch.cuda.is_available())确认按上条命令重装 CUDA 版No module named deepspeed但deepspeed命令可用pip 环境与实际运行的 Python 不是同一个python -m pip list \| findstr deepspeed核对环境统一到一个 venv延伸资源与下一步docs/_tutorials/getting-started.md要写自己的 DeepSpeed 训练脚本、配ds_config.json时看它blogs/windows/08-2024/README.md官方英文 Windows 实践原文核对环境参数和路线图细节时看op_builder/builder.py想搞懂每个算子在 Windows 上如何编译、开关逻辑在哪时看examples/想在仓库内找更多可运行的示例代码时看tests/unit/部署后想快速回归验证各模块功能时看下一篇预告WSL2 环境下 DeepSpeed 与 Linux 原生性能对齐的实测对比4GB 小显存场景该怎么把 offload 收益吃满。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门