新闻详情

新闻详情

首页 / 资讯中心 / 详情

DeepSpeed Windows 安装部署指南:pip 一条命令装好,单卡跑通训练、微调与推理

发布时间:2026/8/31 19:31:25来源:尧图网络
DeepSpeed Windows 安装部署指南:pip 一条命令装好,单卡跑通训练、微调与推理
DeepSpeed Windows 安装部署指南pip 一条命令装好单卡跑通训练、微调与推理【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeedDeepSpeed 是微软开源的深度学习优化库核心能力是 ZeRO 显存优化与 3D 并行可显著降低分布式训练与推理的显存开销。本文给出 Windows 下 DeepSpeed 的完整安装部署步骤并用 CIFAR-10 预训练、LoRA 微调、ZeRO-Inference 推理三个场景验证环境读完即可独立跑通从环境检查到模型出结果的完整流程。部署前的环境自检Windows 原生支持 DeepSpeed 0.14.5 及以上版本训练与推理均可用AIO 异步 I/O 和 GDS 暂不支持。动手前先按下表核对一遍每项都给了可直接复制的校验命令检查项建议配置说明校验命令操作系统Windows 11 23H2 及以上家庭版需先开启开发者模式winverPython3.10 – 3.113.12 暂不在验证范围内python --versionPyTorch2.3.0cu121必须与 CUDA 版本匹配python -c import torch; print(torch.version.cuda)CUDA Toolkit12.1pip 路线无需单独安装仅源码编译需要nvcc -V编译工具链VS2022 C x64/x86 build tools仅源码编译路线需要cl --version⚠️ 顺序很关键无论走哪条路线PyTorch 都要在 DeepSpeed 之前装好。部署路线一pip 快车道适合大多数人Windows 版 pip 包自带全部预编译算子不依赖 CUDA SDK 和本地 C 编译器一条命令完成pip install deepspeed0.14.5安装完成后终端会直接显示 wheel 下载与安装成功无需任何编译过程部署路线二源码编译需要定制构建时需要自行控制算子构建选项、或跟进仓库最新提交时再走源码路线。仓库中 MANIFEST_win.in 定义了 Windows 打包清单build_win.bat 是编译入口git clone https://gitcode.com/GitHub_Trending/de/DeepSpeed cd DeepSpeed build_win.bat pip install dist\*.whl注意两点需以管理员身份运行或打开 Visual Studio 2022 Developer Command Prompt 再提权否则创建符号链接目录会报Access denied算子构建逻辑集中在 op_builder/builder.py依赖清单见 requirements/requirements.txt。安装验证用 ds_report 确认算子状态两条路线装完后都执行同一个体检命令ds_report它会打印 PyTorch、CUDA、deepspeed 版本信息以及每个 C/CUDA 算子的 installed / compatible 状态。JIT 模式下未预装的算子会在首次运行相关功能时按需编译并缓存到~/.cache/torch_extensions/所以看到部分算子显示[NO]不必紧张关键是版本信息与 GPU 检测正常场景演练以下三个场景都基于官方示例脚本DeepSpeedExamples 仓库的training/cifar、training/DeepSpeed-Chat与zero-inference目录硬件为单张 RTX A20004GB 显存。场景 1单卡预训练 CIFAR-108 分钟验证引擎可用性deepspeed cifar10_deepspeed.py --deepspeed在 4GB 显存上约 8 分钟跑完 5 个 epoch10000 张测试图整体准确率 59%其中 plane 类别最高达 76%FP16 训练过程中的动态损失缩放日志正常输出说明混合精度链路完整场景 2LoRA 微调 OPT-125M小显存做监督微调LoRA 即低秩适应只训练插入的小矩阵而冻结原权重参数更新量远小于全量微调。叠加 ZeRO-2 阶段把优化器状态分片到多卡与 CPU offload 后4GB 显存即可运行 0.146B 参数的监督微调SFTdeepspeed main.py --model_name_or_path facebook/opt-125m \ --gradient_accumulation_steps 8 --lora_dim 128 --only_optimize_lora \ --zero_stage 2 --dtype bf16 --offload --print_loss训练日志显示 loss 从约 9.5 稳定下降吞吐约 8 tokens/s、延迟 1.2–1.9msbf16 精度下无溢出跳步场景 3ZeRO-Inference 推理 Llama-2-7B权重卸载到 CPUZeRO-Inference 把模型权重从显存卸载到 CPU 内存甚至 NVMe需要哪一层就调哪一层让 4GB 显存也能跑 7B 模型。这里用 8 token 提示词生成 32 个 token、批大小 64deepspeed run_model.py --model meta-llama/Llama-2-7b-hf \ --batch-size 64 --prompt-len 8 --gen-len 32 --cpu-offload输出摘要显存峰值 2.747GB4GB 卡内decode 吞吐 12.97 token/s整批 832 token 总耗时 157.86s生成内容为连贯的Paris is the capital of...排错手册错误现象可能原因修复动作cl.exe: not found/ 提示找不到编译器未安装 MSVC 构建工具或未用开发者命令行安装 VS2022 C x64/x86 build tools用 Developer Command Prompt 重新执行LNK1181: cannot open input file aio.libAIO 算子在 Windows 上不可用可忽略AIO 与 GDS 不在 Windows 支持范围内CUDA error: no kernel image is available扩展没有针对当前 GPU 架构编译重装与 CUDA 匹配的 torch或设置TORCH_CUDA_ARCH_LIST6.1;7.5;8.6后重新构建Installed CUDA version ... does not match the version torch was compiled with系统 CUDA 与 PyTorch 编译用 CUDA 主版本不一致用nvcc -V与torch.version.cuda对齐版本确需跳过检查可设DS_SKIP_CUDA_CHECK1Access denied、符号链接创建失败终端权限不足以管理员身份运行 PowerShell / 命令提示符首次运行卡顿很久后正常JIT 模式首次编译算子并写入缓存属正常现象想预编译可DS_BUILD_OPS1 pip install deepspeed多 venv 用户用TORCH_EXTENSIONS_DIR隔离缓存进阶方向装好并验证之后还有这些方向可以顺藤摸瓜多 GPU 与多节点训练deepspeed启动器支持--hostfile、--include/--exclude指定资源以及--no_ssh的无 SSH 启动模式详见 docs/_tutorials/getting-started.md配置化调参所有功能开关都收敛在一份 JSON 配置里train_batch_size、zero_optimization、fp16等完整字段参考 docs/_pages/config-json.md算子按需预编译通过DS_BUILD_FUSED_ADAM、DS_BUILD_TRANSFORMER等开关只构建需要的算子清单与功能级依赖见 requirements/ 目录新特性跟进仓库 blogs/ 目录持续更新 ZeRO、DeepCompile、Ulysses 序列并行、SuperOffload/ZenFlow 卸载等能力Windows 支持范围也在逐步扩大关注 blogs/windows/ 即可。写在最后到这里DeepSpeed 在 Windows 上的安装部署链路——环境自检、双路线安装、ds_report验证、三类模型任务出结果——已经完整闭环。想继续深入可以从官方入门教程 docs/_tutorials/getting-started.md 和 Windows 专项说明 blogs/windows/08-2024/chinese/README.md 入手。【免费下载链接】DeepSpeedDeepSpeed is a deep learning optimization library that makes distributed training and inference easy, efficient, and effective.项目地址: https://gitcode.com/GitHub_Trending/de/DeepSpeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

基于YOLO的排水与废弃物检测:从数据到部署的实战解析 2026/8/31 20:16:32

基于YOLO的排水与废弃物检测:从数据到部署的实战解析

简介:本资源是一套基于YOLO目标检测算法的排水系统与废弃物管理智能监控解决方案,面向计算机视觉初学者、环境工程智能化方向开发者及智慧城市项目实践者,聚焦于管道异物识别、垃圾类型分类等真实工业场景的自动化图像分析需求。压缩包共240个…

阅读更多 →
迅雷客户端校招笔试全解析:从数据结构到断点续传的备考指南 2026/8/31 20:16:32

迅雷客户端校招笔试全解析:从数据结构到断点续传的备考指南

2018年那一轮迅雷校园招聘的客户端在线笔试,我到现在还记得拿到试卷时的感受:选择题量不小,编程题不是纯粹的LeetCode风格,而是带业务场景的。当时用的在线笔试平台会实时倒计时,两个多小时看着多,真正动起…

阅读更多 →
Pocket TTS音频输出格式详解:24kHz采样率与PCM数据怎么处理 2026/8/31 20:16:32

Pocket TTS音频输出格式详解:24kHz采样率与PCM数据怎么处理

Pocket TTS音频输出格式详解:24kHz采样率与PCM数据怎么处理 【免费下载链接】pocket-tts A TTS that fits in your CPU (and pocket) 项目地址: https://gitcode.com/GitHub_Trending/po/pocket-tts Pocket TTS(Kyutai 开源的轻量级 TTS 文本转语…

阅读更多 →
广联达2018校招笔试复盘:题型考点与备考策略全解析 2026/8/31 20:16:32

广联达2018校招笔试复盘:题型考点与备考策略全解析

记得那是2017年秋天的事,校园招聘季刚拉开帷幕,我揣着简历奔走在各个宣讲会之间。广联达那场笔试,说实话当时并没有抱太大期望,毕竟这家公司在建筑信息化领域深耕多年,笔试题目向来以基础扎实、覆盖面广著称。但正是这…

阅读更多 →
Sigma-Delta ADC行为级建模:基于Simulink的噪声整形与ENOB仿真实践 2026/8/31 20:16:32

Sigma-Delta ADC行为级建模:基于Simulink的噪声整形与ENOB仿真实践

简介:本资源是一个面向电子工程、信号处理及嵌入式系统方向学习者与工程师的二阶Σ-Δ模数转换器(ADC)Simulink建模仿真包,聚焦高分辨率低速ADC设计核心原理——过采样、噪声整形与动态性能优化。压缩包共7个文件,含6个…

阅读更多 →
基于YOLOv8的固定翼无人机检测与PyQt可视化实战 2026/8/31 20:11:31

基于YOLOv8的固定翼无人机检测与PyQt可视化实战

简介:本资源面向计算机视觉初学者与无人机应用开发者,提供一套开箱即用的小型固定翼无人机YOLOv8检测解决方案,解决目标检测模型训练难、数据集稀缺、部署界面缺失等实际问题。压缩包共2000个文件,含1892个YOLO格式标注txt文件、9…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞