新闻详情

新闻详情

首页 / 资讯中心 / 详情

MindSpeed LLM重计算与异步激活卸载:大模型显存优化完全指南

发布时间:2026/9/26 19:57:49来源:尧图网络
MindSpeed LLM重计算与异步激活卸载:大模型显存优化完全指南
MindSpeed LLM重计算与异步激活卸载大模型显存优化完全指南【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM训练大模型时激活值往往是 NPU 显存的头号杀手——序列越长、Batch 越大前向传播缓存的中间张量就越夸张OOM显存溢出随之而来。本文介绍昇腾分布式训练框架MindSpeed-LLM提供的两大显存优化利器重计算Recompute与异步激活卸载Async Activation Offload并给出新手可直接套用的选型顺序与实战案例 。一、为什么需要这两项技术大模型训练的显存消耗主要来自四部分参数、梯度、优化器状态和激活值。其中激活值占比随序列长度线性甚至平方增长最先耗尽显存。MindSpeed-LLM 针对激活值提供了两条互补路线技术思路代价适用场景重计算前向时丢弃激活反向时重新算额外计算开销通用兜底方案异步激活卸载把激活搬到 Host 内存CPU 侧反向前异步取回Host/Device 拷贝开销长序列、Host 内存充足、可掩盖拷贝官方文档详细阐述了二者各自的背景与瓶颈重计算 与 异步激活卸载。二、重计算三种粒度按需选择重计算的核心是用计算换显存。MindSpeed-LLM 提供三种粒度按需开启即可 ️2.1 全量重计算full显存非常吃紧时的兜底方案只保存 Transformer 层或层组的输入激活值其余全部重算。通过参数开启--recompute-granularity full --recompute-method uniform --recompute-num-layers 2uniform均匀把层均匀分组每组--recompute-num-layers层按组存储输入block分块只对前 N 层重计算其余层保留实现逻辑可参考 Transformer 前向调度入口transformer_block.py。2.2 选择性重计算selective⭐ 推荐只重算 Attention 中的core attention部分把占显存少但重算开销大的激活留在显存里把占显存大但重算便宜的激活丢掉重算。这是显存与性能平衡的最佳选择--recompute-granularity selective2.3 激活函数重计算与细粒度重计算添加--recompute-activation-function可单独开启激活函数重计算并用--recompute-activation-function-num-layers ${num}指定层数可与全量重计算叠加此时仅支持block方法。DeepSeek V4 场景还支持CSA/MHC 细粒度重计算--recompute-csa-attention、--mhc-recompute仅重算特定模块的中间结果详见 DeepSeek V4细粒度重计算。三、异步激活卸载把拷贝藏进计算里重计算的痛点是冗余计算多尤其在长序列下 Self-Attention 计算量随序列平方增长。异步激活卸载Async Activation Offload则走另一条路把激活值张量从 NPU 卸载到 Host 内存显著降低峰值显存同时用异步机制藏起拷贝开销。它由三个机制配合完成D2H 异步卸载前向计算 block 时激活值在独立 stream 上被异步拷到 Host 侧H2D 预取prefetch反向开始之前提前把后续要用的张量从 Host 拉回 NPU多流异步执行D2H/H2D 与计算流并行拷贝被计算覆盖3.1 如何接入该特性以 Python 上下文管理器的形式提供核心入口是async_save_on_cpu按 block 组织张量生命周期with async_save_on_cpu( h2d_streamh2d_stream, d2h_streamd2h_stream, block_idxblock_idx, depthdepth, custom_check_fnyour_check_fn ): output layer(input) # 某个 block 的前向计算关键参数中的custom_check_fn决定哪些张量值得卸载——官方建议筛选计算量大、激活参数量小的部分做 offload激活大、计算耗时短的部分交给重计算否则拷贝开销无法被掩盖。实现代码见 async_offload.py预训练入口的调用示例可参考 qwen3_moe.py 中对async_save_on_cpu的使用。3.2 实测收益长序列场景卸载 Self-Attention 前向激活并在重算时跳过该部分典型场景端到端性能收益20%FSDP2 场景短序列下计算掩盖不住通信卸载激活腾出显存后可增大 micro-batch size 或序列长度端到端性能收益60%四、显存不够了按这个顺序排查优化遇到 OOM 时不要盲目开特性先定位显存花在哪参数/梯度/优化器状态 vs 激活 vs logits再按下述优先级评估——优先选对性能影响小的方案ChunkLoss / 融合算子 → CP / EP / FSDP 切分 → 重计算 → 异步激活卸载 → Swap Optimizer配套工具与文档显存来源分析Profiling 的 Memory 视图见 性能数据采集logits 峰值优化chunk_loss.py其他显存优化特性层输入交换等位于 features_manager/memory/ 目录完整 FSDP2 瓶颈排查与特性选型表格fsdp2_backend_performance_optimization.md五、新手快速上手清单✅ 显存紧张 → 先开--recompute-granularity selective成本最低、收益明显✅ 仍不够 → 叠加--recompute-granularity full --recompute-method uniform扩大重算范围✅ 长序列 / 高显存占比激活 Host 内存充足 → 在 block 前向中接入async_save_on_cpu用custom_check_fn精挑卸载张量✅ 调优后用 Profiling 的 Timeline Memory 视图验证确认 D2H/H2D 被计算掩盖、峰值显存下降✅ 每次只动一个开关用相同口径重新测量 step 耗时与吞吐重计算解决存不下异步卸载解决算太慢——两者组合使用就是 MindSpeed-LLM 面对超大显存需求时的完整答案。掌握这份指南你的大模型训练将再无显存之忧 相关资料重计算官方文档异步激活卸载官方文档DeepSeek V4 细粒度重计算FSDP2 后端性能优化指南异步卸载实现源码mindspeed_llm/fsdp2/features/async_offload.py【免费下载链接】MindSpeed-LLM昇腾LLM分布式训练框架项目地址: https://gitcode.com/Ascend/MindSpeed-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

Open Code Review:开源可落地的代码审查方法论 2026/9/26 23:20:18

Open Code Review:开源可落地的代码审查方法论

1. 项目概述:这不是一个工具,而是一套可落地的开源代码审查方法论“open-code-review”这个词乍看像某个新发布的 CLI 工具名,但实际它指向的是一种正在快速演进的工程实践范式——把代码审查(code review)这件事&…

阅读更多 →
基于Django与深度学习的淘宝用户购物可视化与行为预测系统 2026/9/26 23:20:18

基于Django与深度学习的淘宝用户购物可视化与行为预测系统

又到了毕设选题的季节,每年这个时候都有不少学生来问我:什么题目好写、好过、还能学到东西?今天直接给一个我比较看好的方向——基于Django 深度学习的淘宝用户购物可视化与行为预测系统。这类题目属于典型的数据类Web系统,既有前…

阅读更多 →
WorkBuddy国际版实测:聚合GPT-6、Gemini、DeepSeek 2026/9/26 23:20:18

WorkBuddy国际版实测:聚合GPT-6、Gemini、DeepSeek

最近很多群友都在刷WorkBuddy国际版这个工具,我把它装上用了两周,确实有点东西。它把GPT-6、Gemini、DeepSeek这些主流模型统一塞进一个工作台里,想用哪个点哪个,不用来回开好几个网页、记好几套操作习惯。最狠的是DeepSeek在里头…

阅读更多 →
GPT-6 Sol传闻刷屏?开发者真正该做的模型接入准备 2026/9/26 23:20:18

GPT-6 Sol传闻刷屏?开发者真正该做的模型接入准备

最近这几天,我手机里的大模型交流群基本被两个词刷屏了:GPT-6 Sol和GPT-7 Bel。每隔几小时就有人甩出一张截图,配上"卧槽,Sol要来了"或者"Bel这个代号是真的吗"之类的话。作为一个从GPT-3.5时代就在折腾API的…

阅读更多 →
从零搭建网站前必看:软件开发与网站开发的区别 2026/9/26 23:19:52

从零搭建网站前必看:软件开发与网站开发的区别

从零搭建网站前必看:软件开发与网站开发的区别 想自己做个网站,却连代码是啥都看不懂?别慌,这太正常了。 很多老板、运营、设计师,甚至刚入行的SEO从业者,都卡在这一步。 你以为只要会拖拽模板就能上线,结果一动手发现全是坑。…

阅读更多 →
Win10下DirectShow亲测可用资源拆包与避坑指南 2026/9/26 23:19:13

Win10下DirectShow亲测可用资源拆包与避坑指南

简介:DirectShow_Win10(亲测可用)是一份面向Windows 10平台多媒体开发者的DirectShow学习与开发资源包,适合具备一定C与COM编程基础、希望构建播放器、视频捕获或流媒体应用的开发者。资源围绕DirectShow框架展开,涵盖…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉