新闻详情

新闻详情

首页 / 资讯中心 / 详情

人工神经网络能耗揭秘:从GPU功耗到类脑计算的低功耗AI路径

发布时间:2026/10/1 6:27:48来源:尧图网络
人工神经网络能耗揭秘:从GPU功耗到类脑计算的低功耗AI路径
大家可能见过那句流传很广的话“人脑只有20瓦GPT-3却要400瓦。”第一次看到时我也挺震撼的——一个是几十亿神经元组成的超级计算系统一个只是跑一个语言模型功率差距怎么就这么大。这个对比在网上传了很多年细节却经常是错的。好多人拿它说明“人工神经网络太笨了、太费电了”可真实情况比这复杂得多。这篇我打算把口径拆开把人工神经网络的能耗来源拆开再把大脑的省电机制拆开最后结合我在端侧部署和功耗测试里踩过的一些坑聊聊现在有哪些省电路线真的能落地哪些只是听起来很美。1. 先把账算清楚“20瓦”和“400瓦”到底比的是什么1.1 两个数字背后分别是哪本账先问最基础的问题20瓦和400瓦各自是从哪来的大脑的20瓦指的是一个成年人全脑的代谢功率是一个持续运行的平均值。脑细胞维持静息电位、发放动作电位、合成神经递质、修复细胞结构这些全都要耗能哪怕你安安静静地坐着发呆大脑也在按这个功率默默消耗能量。而GPT-3那个400瓦更接近一块A100加速卡在推理任务下的板卡功耗——注意是板卡功耗不是整台服务器更不是训练过程的电费。训练GPT-3这种规模要做几千PFLOPs级别的计算行业里公开的研究估计一次完整训练要消耗数百到上千兆瓦时电量折算成电费是相当夸张的一笔钱。拿训练总电量去对比人脑的一秒功率本身就是教科书级的“单位都没对齐”。所以网上那些“GPT-3比人脑费电XX万倍”的说法多半是把不同口径的数字硬塞进同一个算式里了。真正该比的其实是同样做一次“智能推理”时两种系统各自要付出多少运行功率和多少总能量。这个维度上大脑依然处在碾压级的位置。换句话说口径虽然要校正但效率差距本身是真实存在的而且比我们能想到的还要深。1.2 比完功耗再看“硬件配置单”讲完口径再看两者的“硬件配置单”。GPT-3是1750亿参数前馈加注意力堆出来的稠密网络人脑神经元总数约860亿其中大脑皮层大概160亿听起来参数规模差不多但连接数完全不是一个级别——人脑突触数量在百万亿这个量级往上走运行时光靠稀疏连接就比GPT-3的全连接矩阵复杂得多。硬件规模比大脑小实际功耗却高出一到两个数量级这正是大家兴奋的点如果能把能耗拉平省下的不只是电费还有数据中心的占地、散热和整个基础设施的投入。但是要把这件事做成得先搞清楚人工神经网络的电到底烧在哪。这也是我接下来想展开的部分。2. 人工神经网络的能耗到底烧在哪里2.1 前向计算、反向传播和数据搬运做深度学习的人都知道一次推理就是把输入张量逐层往前推卷积层做乘加全连接层做矩阵乘激活函数做非线性变形。这个过程落到硬件上主要是MAC乘累加单元在数亿次地翻转同时权重和中间特征要从内存一级一级搬到计算单元。真正烧电的往往不是那些数位运算本身而是数据搬运。做过体系结构的人都清楚访问一次片外DRAM的能耗比做一次浮点乘法高出一两个数量级。模型越大权重越多访存的账单就越吓人。训练阶段还要反向传播梯度从最后一层往回到第一层每一层都要把前向时的激活值拿出来做残差计算和权重更新。这意味着训练过程的计算量大约是前向的三倍内存占用更是爆炸。很多人最初接触BP神经网络可能是在Matlab里跑手写数字识别那时网络小没人关心功耗等模型大到GPT-3这个量级同样的反向传播逻辑就变成了发电厂的账单。2.2 从CNN、LSTM到Transformer结构越聪明电费越吓人人工神经网络的结构演化在精度上越走越远但能耗角度并不是每条路都友好。卷积神经网络靠局部感受野和共享权重节省了大量参数这是它在2012年后成功的关键。循环神经网络和LSTM则要维护一个隐状态序列按时间步一步步展开门控矩阵和单元状态都在反复做矩阵乘训练还要用基于时间的反向传播BPTT长序列下计算和显存消耗会按时间长度累积。Transformer走的是另一条路。注意力机制让任意两个token都能交互精度上占尽便宜代价是计算复杂度随序列长度平方增长。加上自回归生成时每一步都要重新加载权重和缓存KV推理时的功耗相当稳定地维持在高位。除了这些主线工程里还有不少“结构换能效”的衍生网络小波Elman网络把多尺度分解接进反馈结构图神经网络处理非欧空间的消息传递Neural ODE则把网络层看成连续动力系统用神经网络参数化导数、用ODE求解器推进——听起来很优雅但求解器每一步数值迭代都要完整跑一遍网络省下的参数又花在了时间上。可以说没有任何一种结构是天然省电的省电与否取决于计算密度和访存模式。真正想低功耗就得回到最底层的“算力-带宽-能效”三角里做取舍。2.3 一个常被忽略的能耗大头中间激活与带宽做推理优化的人会发现一个反直觉现象有时候计算量明明降低了功耗却没降多少。原因往往出在中间激活值上。Transformer的每一层都要把特征图、注意力矩阵、FFN中间层临时写进显存batch大小和输入序列一拉长中间激活的大小甚至会超过权重本身。显存带宽是有限资源数据写进写出都要耗电。我在跑神经网络TTS时也踩过类似坑模型本身很小但每帧都要生成频谱还要重复加载状态缓存导致GPU一直处于“空转等高带宽”的状态功耗下不去。想要真正省电光数FLOPs没用得算数据和计算的比例到底是多少。这个比例业内常叫arithmetic intensity决定了这段网络到底是计算密集还是访存密集也决定了该往哪个方向优化。3. 大脑凭什么只用20瓦三个反直觉的省电机制3.1 事件驱动不响铃就不工作人脑神经网络在信息处理上有个很重要的原则少就是多。神经元并不是每个周期都放电而是等膜电位累积到阈值后偶尔发一个脉冲静息状态下放电率极低皮层神经元平均每秒只有个位数到几十个脉冲。这意味着大脑的大部分突触在大部分时间里是“沉默”的能量主要用于维持静息电位而不是做大规模同步计算。GPU恰恰相反芯片内部的时钟让所有晶体管每个周期都在同步翻转不管当前这批数据用不用得上功耗都是一笔固定开销。打个比方大脑像一间不响铃就不工作的办公室GPU则像一间常年把走廊灯光、广播和每台电脑都开满的机房。事件驱动带来的省电效果是数量级的。3.2 终身学习不做全局反向传播人工神经网络训练的能耗大户是反向传播全局损失要回传梯度到每一层每一层都要更新权重。大脑从来不走这条路。突触的可塑性是局部的当一个神经元反复参与另一个神经元的放电它们之间的突触会变强这叫Hebbian规则更精细的还有STDP机制按脉冲到达的先后顺序调整连接强弱。整个过程不依赖一个全局误差信号也不需要存储前向的激活值来回放。可以说大脑把“训练”融进了“运行”里边干活边更新而不是像神经网络那样先花几个月训练再上线推理。这也是为什么大脑能在20瓦的预算内同时保持学习能力而通用神经网络要跑一遍完整训练流程电费惊人。3.3 用结构省电稀疏连接、侧抑制与突触修剪大脑的第二个秘密是“用结构换效率”。皮层是高度分层组织的视觉、语言、运动各有各的专用通路同级神经元之间还普遍存在侧抑制谁被激活得强就压住周围神经元形成稀疏的胜者全拿编码。这种稀疏化让每个时刻真正处于激活状态的神经元比例很小自然就省了电。更重要的一点是大脑会修剪突触。儿童时期突触密度达到峰值随后十几年持续修剪保留经过验证有用的连接。这跟神经网络剪枝其实是同一件事——只不过大脑是在能量预算的强约束下被迫剪的把冗余连接当作浪费电的负担。反观现在的大模型训练完反而把全部权重都留在那张庞大的稠密矩阵里推理时代价自然被加倍放大。4. 向大脑抄作业低功耗AI的现实路径4.1 软件侧优先级量化、剪枝、蒸馏、稀疏化怎么排把大脑的启发落到工程里第一件能做的是软件侧优化。我的做法通常按“收益/成本”排序先做量化。FP16转INT8通常能把访存带宽需求砍半在很多硬件上还能用上低精度算子关键是把归化因子的校准做好再加一点量化感知训练精度掉点一般能控制在半个点以内。第二是结构化剪枝直接删掉不重要的通道或注意力头因为非结构化剪枝在稠密矩阵硬件上几乎没有加速收益。第三是蒸馏用小模型学大模型的注意力分布换来的是推理阶段直接降到原来的几十分之一规模。最后才是稀疏化包含稀疏激活、稀疏注意力等等——这一项在通用GPU上收益有限必须配合专门支持稀疏计算的硬件。把这四项按顺序做下来通常能带回一个量级以上的功耗下降。4.2 硬件侧尝试多核调度、存算一体与Versal ACAP软件优化有天花板真正想逼近大脑的效率还得动硬件。先说一个经常被忽略的问题通用神经网络处理器下的多核调度问题。现在手机SoC里的NPU、数据中心里的AI加速卡内部不止一个计算核心网络层的矩阵乘往往被切分到多个核心上并行。切分方式很有讲究按batch切分的话各核心任务独立通信开销小按层内切分的话每个核心只算一部分输出通道结果要跨核拼接访存同步就是个坑。我在实际工程里见过不少例子四核NPU跑一个小模型延迟反而比单核还差就是被同步和内存竞争拖垮的。调度之外存算一体是另一个方向让权重在存储单元里直接参与乘加计算省掉数据搬运。阻变存储器之类的方案在学术圈已经做了多年产品化还没完全成熟但在特定低精度推理场景里已经能压出很低的功耗。工业界一条更务实的路是自适应计算平台像Versal ACAP这种芯片把可编程逻辑和AI Engine阵列放在一起——想换网络结构时不用流片在PL里定制数据通路用AI引擎做高吞吐向量计算。我拿它跑过实时视频流和神经网络推理小批量、低延迟场景下功耗控制确实比纯GPU从容得多。但代价是开发门槛极高工程团队要同时懂RTL、C语言和系统架构。4.3 神经拟态芯片和SNN看着很美落地还早既然大脑是事件驱动的干脆做事件驱动的芯片不是更直接吗工业界确实尝试过IBM TrueNorth、Intel Loihi、Loihi 2都是这个思路。神经拟态芯片用脉冲神经网络SNN神经元只在有事件时发脉冲计算和存储天然融合理论功耗比同规模传统加速卡低几个数量级。听起来是终极答案但真拿去跑任务就会发现问题SNN的训练算法远没有BP成熟精度在ImageNet、语言模型这类任务上掉点严重现有工具链和生态也远不如PyTorch、TensorRT成熟很多算法工程师根本没法上手。这几年不少团队把SNN用在低功耗语音唤醒、神经形态视觉传感器这类信号稀疏的场景效果不错但要让它在通用AI任务里替代GPU还有很长的路。所以我的判断是类脑是方向但真正能在明年就落地的低功耗方案还是量化加剪枝加专用加速器那一套组合拳。5. 我在功耗评测里走过的弯路5.1 误区一把训练电费和推理功率混为一谈这是最容易出现的错误。前面已经提过训练是“一次性把所有数据算很多遍”训练GPT-3要烧掉几百上千兆瓦时推理则是“每次生成一个token都要重跑一遍网络”。两者根本不是同一本账。我们平时说400瓦是推理时某块板卡的瞬时功耗说训练耗电则要按用电量而不是功率来讨论。网上很多对比把训练电费说成“GPT-3用了多少瓦”属于典型的口径污染。工程上做能效预算时一定要分场景写清楚训练一次多少度电、每秒能跑多少次推理、单卡瞬时功耗多少三张表各归各的混在一起只会得出完全没用的结论。5.2 误区二把GPU标称功耗当真值我刚开始做功耗测试时走过弯路直接读nvidia-smi里的Power Limit当作实际功耗来算能耗比。后来把功率计接到AC电源上才发现显卡标称的TDP和实际工况差很多。同样是跑Transformer推理batch1时GPU大部分时间在等待数据搬运功耗只有额定的一半batch拉大把计算打满后功耗才逼近TDP。更坑的是GPU会动态升降频温度一高就降频降功耗服务器整机还要算上CPU、DRAM、风扇、电源转换损耗。所以任何号称“毫瓦级/瓦级”的指标最好都自己用功率计复核。我现在的习惯是放在同一台机器上、固定室温、跑稳定至少5分钟后读数取多次稳态值平均。5.3 误区三觉得“省电更快”量化一定赚省电和提速不是一回事。有些硬件对INT8支持很好量化后既省电又快比如端侧NPU但在老一代GPU上把数据从FP16转INT8反量化、重新布局的操作反而会拖慢速度。剪枝也一样非结构化稀疏在稠密矩阵硬件上完全没有加速只是白白把模型做小真正的收益要等硬件支持2:4稀疏或者专门的稀疏加速器。所以做优化时要先问我的瓶颈是访存、计算还是延迟量化主要是降访存带宽剪枝主要是降参数存储和部分计算蒸馏主要是降模型规模别一听“省电”就上全套优化结果电没省多少体验反而差了。5.4 实测记录4个真实场景的排查清单下面这四类问题我在端侧和服务器部署时都踩过列成速查表可能对你有帮助。场景现象排查结果端侧NPU跑小模型四核比单核还慢多核之间同步和访存竞争严重切分策略没做好服务器跑TransformerGPU功耗远低于TDPbatch太小访存阻塞计算资源空转拉大batch后功耗才上来模型量化后延迟没降功耗微降硬件对INT8算子支持弱反量化开销吃掉了收益跑神经网络TTS功耗高但不卡频谱生成和状态加载串行带宽瓶颈改成流式管线后功耗降了20%每一条背后都能再展开讲十分钟但核心教训是一致的别拿标称值、平均值和峰值混着用别脱离硬件谈优化。做能耗优化时第一件事永远是先把测量做好——没有可靠的功率计数据后面所有结论都是猜。最后聊点个人体会。我做过几次低功耗部署之后最大的感受是大脑的20瓦并不是因为它“算得少”而是因为它把大部分计算都安排在了最恰当的时刻和最合适的位置平时绝不空转更新发生在局部结构本身就在替它省电。这给我们做AI工程的启发其实很朴素——先把度量和边界搞准确再用硬件特性倒推软件优化比一味追求“类脑”更务实。如果这篇里的哪一条能帮你少走一次弯路那就不算白写。我自己后面还打算把“能耗感知的推理调度”做成一套小工具让每个请求都能按实时电价和硬件状态自动选择模型档位——从这个角度看能效优化的路还长着呢但每一步都值得走。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

2026年GEO优化服务商行业全景分析,对话逻辑分析与信用链条搭建能力调研报告 2026/10/1 21:27:56

2026年GEO优化服务商行业全景分析,对话逻辑分析与信用链条搭建能力调研报告

2026年,企业的第一问正在从搜索引擎的输入框转向AI对话框。当采购负责人向豆包、DeepSeek、元宝、千问询问工业撕碎机哪家强食品机械推荐几个靠谱厂家时,AI给出的答案里有没有你的企业名字,直接决定了订单流向谁。在这一轮由生成式引擎优化&a…

阅读更多 →
DataHub V10升V11.1,证书和权限怎么查? 2026/10/1 21:27:56

DataHub V10升V11.1,证书和权限怎么查?

V10可以继续运行;准备升级V11.1时,先核对许可证,再备份配置、复核权限、测试证书与连接,最后演练回退。生产切换应在关键数据链路验证通过后进行。 Cogent DataHub 10已于2026年7月2日结束生命周期(End of Life&#x…

阅读更多 →
Overleaf编译慢?从图片压缩到本地部署的提速完全指南 2026/10/1 21:27:55

Overleaf编译慢?从图片压缩到本地部署的提速完全指南

每次点了Recompile,盯着右上角那个绿色的圈转啊转,三五分钟过去还是那句“Compile timeout”,真是让人血压升高。我写毕业论文那阵子,十几章的项目编译一次能把一壶水烧开,改一个字进去,整个文档从头到尾重…

阅读更多 →
学生模型为什么会把“不知道”答成“看起来知道” 2026/10/1 21:27:55

学生模型为什么会把“不知道”答成“看起来知道”

这是蒸馏里最容易被误判的一类问题。输出句子通顺、结构完整,甚至和教师模型风格很像,但关键事实并没有证据。模型并非真的“知道”,而是把教师的确定性语气和常见回答模式一起模仿了。 先拆开“知道”的组成 我通常把一条回答拆成事实、证据…

阅读更多 →
长三角正规的工业撕碎机GEO优化服务商筛选名录:EEAT内容扎实,400号码露出多 2026/10/1 21:27:49

长三角正规的工业撕碎机GEO优化服务商筛选名录:EEAT内容扎实,400号码露出多

长三角工业撕碎机企业都在问:AI搜索时代,如何被客户第一句话就找到当采购方把求推荐固废破碎设备厂家输入豆包、DeepSeek、Kimi时,你的企业名字是否出现在答案里? 如今装备制造行业的采购决策第一站,正加速搬到AI对话框。苏州聚合…

阅读更多 →
AI开始“设计”量子计算机,错误率最高降了63倍 2026/10/1 21:27:49

AI开始“设计”量子计算机,错误率最高降了63倍

量子计算机怎么设计,可能正在交给AI。 近日,德国量子计算公司QC Design发布最新白皮书,公布了其专为容错量子计算设计的AI系统Meridian的测试结果。 在超过100项容错设计任务中,Meridian生成的方案,其逻辑错误率中位数…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉