新闻详情

新闻详情

首页 / 资讯中心 / 详情

从零搭建开放式显卡矿机:散热、功耗墙与无人值守实战

发布时间:2026/10/2 6:52:52来源:尧图网络
从零搭建开放式显卡矿机:散热、功耗墙与无人值守实战
1. OpenRig 是什么我为什么坚持把矿机做成开放式机架第一次把 OpenRig 点亮的时候我蹲在地上数了三遍确认六张显卡全部被系统识别才敢松一口气。这个项目名字其实没什么玄机拆开就是 open 加 rig一套彻头彻尾开放式的显卡矿机。机架是开放式的没有侧板、没有机箱、没有一切挡住空气流动的东西软件栈是开放式的系统层用开源方案矿工用社区维护的开源程序连看护脚本都是自己一行行写的走线思路也是开放的每一根电源线、USB 转接线都顺着铝型材走一眼能看到底出了问题不用把 20 斤重的机箱翻过来找线。为什么要做开放式而不是买现成机箱原因很直接显卡矿机的散热核心不是靠风扇转速堆出来的而是靠风能不能顺畅地流过散热鳍片。封闭机箱里六张卡排在一起前后风扇互相抢风后面几卡的温度能比前面高出十几度这是我在第一台整机矿机上吃过亏才明白的。OpenRig 的设计思路就是让显卡平放在框架中间风扇面朝上四周无遮挡下方冷空气自然补进来上方热空气直接散掉。开放式机架在同等室温下能把核心温度压下来 10 到 15 摄氏度这个差距直接决定夏天要不要开空调、要不要降功耗。这套项目适合什么人我理解中的目标读者是这几类想把手头显卡利用起来、又不想整天对着命令行发愁的硬件爱好者对 Linux 运维有兴趣、想练手脚本和监控的同学以及单纯喜欢折腾机器、享受从一堆散件里拼出一台能 24 小时无人值守设备的人。反过来如果你的预期是买回来插上电就开始躺着收钱那我劝你先冷静把电费、噪音、故障率这三笔账算清楚再说OpenRig 首先是一个硬件集成和运维项目算力只是它的附加产物。下面我会把从硬件选型、机架组装、软件配置到一个月实测和踩坑排障的完整过程都写出来尽量把每一个“为什么这么做”讲透。2. 硬件清单与选型逻辑每个零件都能讲明白为什么组装矿机最忌讳的就是照着别人的配置单盲买。二手市场上你能看到的矿机配置五花八门但核心逻辑是统一的主板决定能插几张卡电源决定敢插几张卡转接线决定稳定性的下限。我这张配置单是按照 6 卡规模、长期无人值守、兼顾电费和温度来定的你完全可以在这个基础上加减。配件我的选择理由主板B250 BTC 矿板12 个 PCIe 插槽原生支持多显卡插槽间距大显卡安装不再挤CPU赛扬 G4900显卡矿机的算力全在 GPU 上CPU 只干驱动的活买贵的纯属浪费内存8GB DDR4 单条HiveOS 加矿工进程加起来吃不到 2GB8GB 留足余量硬盘16GB U 盘跑 HiveOS安装快、坏了换一个就行、不占用 SATA 口电源两个额定 850W 金牌电源6 卡总负载约 850W双电源各自半载运行时转换效率最高显卡6 张 RTX 3060 Ti单卡功耗在 115W 到 130W 区间就能维持可观算力散热压力小转接线6Pin 直供电型 PCIe x1 转 x16供电规范、接触可靠后面单讲为什么不能用 SATA 供电的便宜货2.1 矿板、普通主板和转接方案的取舍主板是整个机器的骨架。我选的这种带十几个 PCIe 插槽的矿板本质上是把插槽的间距拉大、供电简化、去掉一堆用不上的接口换来的网上几十块到两三百块就能收到很多二手。它的好处是插槽间距够大六张双槽卡插上去不用考虑物理干涉也不用加 M.2 转接卡这种容易出兼容问题的东西。如果你手上只有普通 ATX 主板也不是不能玩前提是你得搞清楚自己的主板上到底有几个能用的 PCIe x16 物理插槽以及 M.2 转接卡的兼容性。普通主板的 M.2 是给 SSD 用的走的是 NVMe 通道插上 PCIe 转接卡后能不能稳定把显卡识别出来很看主板的 BIOS 实现。我的经验是如果你打算认认真真跑 6 卡以上直接上矿板是最省心的省下来的调试时间成本远超多花的几十块钱如果只是拿两三条插槽练手普通主板完全够用。2.2 电源功率计算为什么是两个 850W 而不是一个 1600W电源选型是整台机器安全性的分水岭这里必须动手算一遍。以我这 6 张 3060 Ti 为例每张卡在 HiveOS 里把功耗墙锁到 130W显卡总负载就是 780W再加上主板、CPU、U 盘、风扇和转接线的消耗整个系统直流负载大约是 850W。如果用单个 1600W 电源负载率在 50% 左右其实也能扛但市面上单路 1600W 的消费级电源选择少、价格高而且一旦它出问题整机直接全挂。所以我走了双电源路线两个额定 850W 的电源每个电源负责三张卡的供电和对应转接线负载大约在 425W正好落在 50% 负载的黄金效率区。这里有个容易忽略的点长期满载接近额定功率运行时电源内部的电容和整流桥老化速度会明显加快而半载运行可以让所有关键器件都工作在轻松状态这也是一台矿机能不能跑满一个月不掉线的底层保障之一。请记住一个原则电源的实际连续输出不要超过额定功率的 80%。六张 130W 的卡加系统 850W 的负载用两个 850W 电源冗余率接近一倍不是烧钱是买安稳。2.3 转接线供电规范SATA 线救不了高功耗显卡转接线Riser是把显卡和主板插槽拉开距离的关键配件也是最容易出事故的配件。市面上的转接线分为免供电型和供电型免供电型只有一根软排线供电完全靠主板的 PCIe 插槽只适合功耗 75W 以下的入门卡对 3060 Ti 这个级别的卡想都不要想。供电型转接线才是矿机的主流选择。供电型转接线内部又分为用 SATA 电源口和大 4Pin 供电的版本以及用 PCIe 6Pin 直接供电的版本。这里我吃过教训SATA 电源接口的设计电流上限大约是 12V 4.5A也就是 54W而一张 3060 Ti 就算功耗墙压到 130W它从转接线这里最多可能吃掉接近 75W 的槽位供电。更危险的是很多人会用一根 SATA 线串联两个甚至三个转接线电流全部挤在一根细线上走时间长了线材发热、绝缘皮变软最后烧掉的事故我见过不止一次。所以我的建议很简单只买 6Pin 直供电版每个转接线单独从电源拉一根线不串联、不分享。还有一个容易忽视的细节同一张显卡的 8Pin 供电线和它的转接线供电最好接在同一个电源上。两个电源虽然地线是共通的但不同电源的电压会有细微差如果显卡本体吃一个电源、转接线吃另一个电源等于人为制造了一个电流回路长期下来有可能导致显卡供电模块工作异常。我在 OpenRig 里给每个电源分配的三张卡都是显卡和转接线一起走的。3. 机架设计与组装一小时后亮机三小时后走线机架是 OpenRig 的外貌也是散热和走线的载体。我当初在木质框架、金属角钢和铝型材之间纠结过。木架便宜但导热差、受潮会变形角钢强度够但太重、边角锋利最后选了 4040 铝型材也就是常说的欧标铝型材重量轻、强度够、表面有 T 型槽所有的螺母都能直接嵌进槽里滑动定位改造起来非常方便。3.1 铝型材的尺寸设计与物料清单设计 6 卡机架时我定了一个 1200mm 长、500mm 宽、400mm 高的双层结构底层放主板和电源上层悬空挂显卡。这个尺寸是我根据 3060 Ti 的长度反推出来的显卡大约 300mm 长1200mm 的框架长度能保证六张卡排开之后头部还有富余空间给供电线转弯500mm 的宽度则是让显卡风扇面朝上平放时边缘离型材还有 3 到 4 厘米的进风缝不会被框架挡住。物料清单如下找型材商家按尺寸切割后自己组装四根 1200mm 主梁十根 500mm 横档六根 400mm 竖档外加十六个角件和配套的 M8 螺丝、T 型螺母。这些东西用内六角扳手就能装完全不需要电焊和台钻。3.2 安装顺序先松后紧先主板再显卡组装的顺序直接影响后续调整的方便程度。我第一次组装时是把所有螺丝都锁死了再装主板结果显卡挂上去之后发现间距差了 5mm又全部拆开重新定位。正确顺序应该是先把框架粗略拼起来所有螺丝只拧到七八分紧然后把主板固定在底层的一侧、两个电源放在另一侧接着把显卡挂到上层的横梁上确认每个挂点都能对齐最后再逐个锁紧所有螺丝。别小看这一步矿机跑起来之后震动不小铝型材连接处如果没锁紧几个月下来T 型螺母会慢慢松动显卡供电插头也会跟着虚接。显卡的固定方式也很简单显卡尾部挡板上有两个螺丝孔用一个“显卡挂条”卡在 4040 型材的槽里再把这两个孔锁到挂条上显卡就稳稳地水平悬在框架中间了。风扇面朝上热气直接往上走。3.3 走线是稳定性的隐形工程装好硬件之后的走线环节我花了比装机更多的时间。矿机的重启故障里有很大一部分不是电源不够、不是显卡坏了而是供电线头没有插到底——尤其是 PCIe 8Pin 这种带卡扣的插头插的时候必须听到“咔哒”一声才算到位。我刚装 OpenRig 时有一根显卡供电线偷懒没插紧结果机器一进入满载就重启害我排查了大半天才找到。走线的核心原则是把所有线材固定在型材槽里给每根线两头贴上标签。比如 “P1-GPU3”意思是电源 1 的第几根 PCIe 线接在显卡 3 上。矿机不像家用电脑那样光线杂乱无所谓它需要频繁插拔维护没有标签的线束在排查问题的时候会让人崩溃。USB 转接线则要特别注意它的插头比较娇气不要硬弯成直角尽量让线自然弯曲固定时留一点余量。还有一个小技巧走线时把显卡供电线从机架的外侧绕下去贴着型材的槽走到电源这样显卡正上方是完全敞开的进风口的灰尘会少一些也方便日常用鼓风机清理。4. 软件栈与无人值守从 U 盘系统到自愈脚本硬件装好只是第一步OpenRig 真正让人省心的是软件层。我的建议是直接上 HiveOS而不是在 Windows 上跑矿工。原因有三一是 HiveOS 是 Linux 系统内存占用小驱动程序已经内置写进 U 盘开机就能跑二是它带网页管理面板能远程看每张卡的算力、温度、功耗不用天天搬显示器三是它有自愈功能矿工程序异常退出能自动拉起来这在无人值守场景下是刚需。HiveOS 对 3 台以内的机器有免费额度个人用户先用免费档体验完全够。如果你想走完全开源的路线也可以用 Ubuntu 服务器版自己搭矿工用 TeamRedMiner、lolMiner、NBminer 这类社区维护的开源程序再自己写看护脚本。我后来就是把 OpenRig 从 HiveOS 迁到了 Ubuntu 自建方案不为别的就为了彻底掌控每一个进程顺便把监控脚本当成一个长期维护的练手项目。4.1 BIOS 里最容易错的三个设置矿机上电后能不能顺利把所有显卡认全第一道坎是 BIOS。以我的经验有三个设置是必查项。第一关闭 Secure Boot。Linux 系统加载第三方显卡驱动时依赖未签名的内核模块开着 Secure Boot 会导致驱动加载失败表现就是系统能进、nvidia-smi 什么都看不到。第二开启 Above 4G Decoding。这个选项在部分主板上叫 Resizable BAR 或者大于 4G 地址空间解码它的作用是让系统能够给多张显卡分配 64 位内存地址。插四张卡以上的矿机不开启它最常见的结果就是识别不全、随机掉卡。不过我也遇到个别老矿板开了它反而认卡顺序错乱的情况如果你按这个设置调整后问题反而变多可以试着关掉再开一次。第三把 PCIe 速率强制到 Gen1。矿机用的转接线是 PCIe x1 通道跑在 Gen1 就是标准速度跑 Gen3 反而容易因为信号衰减导致识别不稳定。很多矿板的默认值就是 Gen1但普通主板默认 Auto建议直接改死。除此之外如果主板有核显把 Primary Display 设成 IGFX避免独显初始化失败时整机黑屏。4.2 用 nvidia-smi 和脚本做算力守护裸跑 Ubuntu 最大的问题是“矿工挂了没人知道”。矿池后台虽然能看到掉线但那只是被动告警不会帮你把进程拉起来。我写了一个简单的看护脚本放在 /opt/openrig 下由 cron 每三分钟执行一次。它的逻辑很简单检查矿工进程是否在跑如果不在自动重启如果所有显卡的最高核心温度超过 80 度就把功耗墙临时压低一档等温度回落后再恢复。#!/usr/bin/env bash # OpenRig 看护脚本进程检查 过热自动降压 LOG/var/log/openrig-watchdog.log if pgrep -f lolMiner /dev/null; then HIGHEST$(nvidia-smi --query-gputemperature.gpu --formatcsv,noheader,nounits | sort -n | tail -1) echo $(date %F %T) 矿工正常最高核心温度 ${HIGHEST}℃ $LOG if [ $HIGHEST -gt 80 ]; then nvidia-smi -pl 110 echo $(date %F %T) 温度过高功耗墙临时降至 110W $LOG else nvidia-smi -pl 130 fi else echo $(date %F %T) 矿工进程退出正在重启 $LOG cd /opt/miner nohup ./lolMiner --coin etc --pool 你的矿池地址 --port 端口 \ --user 钱包地址.rig1 /var/log/openrig-miner.log 21 fi配合 cron 使用*/3 * * * * root /opt/openrig/watchdog.sh /dev/null 21这种脚本的难点不在脚本本身而在于你要清楚“什么状态算正常”。比如显卡在 80 度临界点反复横跳时我上面的写法会让功耗墙在 110W 和 130W 之间来回切实际上对稳定性反而不好。后来我加了一个冷却时间高温后半小时内不允许恢复功耗墙。这种细节只有跑出问题才会想到写脚本时提前考虑进去能少很多麻烦。4.3 远程运维的两件套SSH 密钥与日志无人值守的另一半是远程登录。我给 OpenRig 开了 SSH并且只允许密钥登录、禁止密码登录这样比密码暴露在外网安全得多。日常维护就是手机连上 Termius跑一下 nvidia-smi 看一眼温度或者 tail 一下矿工日志看看最近有没有频繁重启。日志这块我要多说一句矿工日志是最便宜也最有效的排障工具。系统跑崩了、算力掉了、显卡偶尔不响应绝大多数情况都会在日志里留下线索。不要一上来就换显卡、换转接线先把日志翻一遍很多问题一眼就能定位。5. 实测数据与踩坑实录完整排查链路和温度账单OpenRig 调好之后我连续跑了 28 天期间只因为一次小区停电重启过。下面把这段运行的实测数据和几个典型的踩坑过程写出来供你参考。5.1 第一次上电就遇到的“双电源不同步”组装完第一次通电我以为万事大吉结果发现一个很尴尬的问题两个电源里只有一个跟着开机键同步启动。当时我想当然地用了“短接第二电源 PS_ON 让它常开”的土办法结果关机之后第二电源还在嗡嗡转风扇停不下来第二天回家发现整台机器被家里人直接拉了总闸。这个坑的本质是双电源之间没有开机信号同步。正确的解决办法是买一根双电源同步启动线本质是一个小电路板把两个电源的 24Pin PS_ON 信号并联起来你按开机键时主板给第一个电源发启动信号同步线同时把信号转给第二个电源两者一起上电、一起断电安全性和可靠性都远好于短接常开。这根线十来块钱和电源的价格相比不值一提别省。5.2 显卡只认出一半完整排查链路装机后第一次开机六张卡只认出了四张。这类“识别不全”的问题在矿机上极其常见下面是我完整的排查链路按顺序走别跳步。第一先确定故障跟着谁走。关机把没被识别的那张显卡连同它的转接线一起换到已知正常的位置。如果换过去之后这张卡还不能被识别那问题大概率出在显卡或者转接线本身如果换过去就好了那问题出在原来的 PCIe 插槽或者转接线的供电上。这一步能把排查范围缩小一半。第二检查转接线供电。拆下那张异常的卡把转接线的 6Pin 供电重新插一遍换一根单独的电源线给它供电再上电看结果。很多时候就是供电插头虚接导致的识别失败。第三回到 BIOS 检查三项设置Secure Boot 关闭、Above 4G Decoding 开启、PCIe 速率改为 Gen1。修改后逐项重启验证。第四如果还不行用最笨的办法把主板所有 PCIe 插槽挨个测一遍。每张卡单独插 1 号槽能亮就说明卡本身没坏插槽有问题如果某张卡在哪个槽都不亮再考虑换转接线、换驱动版本。我的经验是在这套流程里真正显卡坏掉的情况很少转接线供电和 BIOS 设置占了八成的故障来源。5.3 夏季高温与功耗墙调校开放式机架在 25 摄氏度室内环境下六张 130W 的 3060 Ti 实测核心温度稳定在 55 到 60 摄氏度显存温度大概 70 到 75 摄氏度风扇转速不需要拉满噪音在可接受范围。这个温度表现是开放式设计的最大价值换到普通机箱里至少要再高十度。到了室外 33 摄氏度、房间没开空调的时候实测温度明显上来了核心逼近 75 摄氏度显存超过 82 摄氏度。我做了两个调整第一把功耗墙从 130W 降到 115W算力损失大约 3% 到 5%核心温度掉了 6 摄氏度左右电费也省了一截第二在机架一侧加了一个 14cm 低速机箱风扇平吹显卡噪音几乎没有温度又压下来 3 到 4 摄氏度。这套组合拳比开空调省得多也是大多数矿机夏季的标准做法。降功耗的思路要说清楚功耗墙的本质是限制显卡的核心电压和频率上限让它在接近最优点的地方工作。显卡的能耗曲线不是线性的130W 和 115W 之间的算力差远没有功耗差那么大所以降功耗在大多数情况下是“赚”的。具体降到多少还要看每张卡的体质同一型号不同个体能差出 5% 的温差和功耗表现所以一定要以你机器上的实测为准。5.4 一个月账单与稳定性记录用电量这块我用了带功率计的插座实测整机日常在 900 到 950W 之间波动按 900W 算一天 24 小时就是 21.6 度电按每度六毛钱算一天电费大约十三块。这个数字不包含降温空调的额外开销如果夏天房间不开空调扛不住还得把这个成本算进去。稳定性方面28 天里只有小区停电导致的一次意外断电重启。另外有一次某张卡的风扇轴承开始出现异响风扇转速异常导致显存温度拉到了 83 摄氏度我配的看护脚本检测到之后把功耗墙压到了 110W温度回落到 72 摄氏度整机算力损失极小。如果没有这个自动降压机制大概率会在这天夜里出现一次热保护掉算力。事后我换了那张卡的风扇把功耗墙调回 130W一切恢复正常。灰尘问题也值得记录开放式机架积灰速度远快于封闭机箱一个月后散热鳍片边缘就明显看到灰尘。我每个月用鼓风机冷风档吹一次吹完显存温度能降 2 到 3 摄氏度。如果你有条件装一层可拆洗的防尘网也可以装上但要注意别挡死进风口否则散热效果得不偿失。6. 写在最后三件被学费换来的小事折腾 OpenRig 这段时间有三件事是我想特别提醒后来者的。第一给每一台机器做一张“配置身份证”。把主板型号、BIOS 里改了哪几个选项、每张卡的功耗墙、每根电源线对应哪个插槽全部记下来最好再截一张 BIOS 设置页面的图。机器出问题时这张身份证能让你省下至少半天的排查时间尤其是当你手里有多台机器的时候记混配置是家常便饭。第二转接线和电源上花的每一分钱都值得。很多人在显卡上舍得花钱在转接线上却挑最便宜的买在电源上买杂牌高额定功率。这两个部位恰恰是整台机器事故率最高的地方。宁可把显卡预算降一档也要把电源换成一线的正规金牌电源把转接线换成 6Pin 直供电的版本。这个优先级很长时间内都不会变。第三别把 OpenRig 当成一个“躺着赚钱”的项目。它的真正价值在于把从硬件选型、结构设计、系统配置到自动化运维这一整条链路完整地走一遍这些技能放在哪个技术方向上都不过时。至于算力能换来多少收益那是市场行情、币种选择和设备维护共同决定的事不是这台机器本身能承诺的东西。抱着练手的心态做你会收获更多翻车的概率也更小。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

读懂GitHub日榜:从信号解读到开源项目评估的完整指南 2026/10/2 7:48:18

读懂GitHub日榜:从信号解读到开源项目评估的完整指南

GitHub日榜(daily trending)这个入口,我每天至少要看两遍,早上刷一遍,下班前再瞄一眼。2026-09-25这一天的榜单我也照惯例过了一遍,说实话,大部分项目还是那几种熟悉的面孔:围绕AI编…

阅读更多 →
数字回形针:用命令行实现零拷贝的临时文件聚合工具 2026/10/2 7:48:12

数字回形针:用命令行实现零拷贝的临时文件聚合工具

1. 为什么我会用一个“paperclip”来命名这个项目1.1 实体回形针和数字回形针的共同本质paperclip这个词,直译就是“回形针”。按理说,回形针是办公桌上最不起眼的东西,一盒一百根,用完就扔,没人会把它当回事。但真正让…

阅读更多 →
GitHub热榜深度解读:从刷榜到项目评估与源码学习 2026/10/2 7:48:12

GitHub热榜深度解读:从刷榜到项目评估与源码学习

每天早晚各刷一遍 GitHub 热榜(Trending),是我这些年雷打不动的习惯。2026年9月25日这份日榜,我在午休前完整过了一遍:前排的 star 涨幅、新上榜的面孔、老项目的例行更新,都扫了一眼。这篇文章不谈“哪个项…

阅读更多 →
SMETANA实战:从OTU丰度表到物种共丰度网络的全流程指南 2026/10/2 7:48:12

SMETANA实战:从OTU丰度表到物种共丰度网络的全流程指南

做宏基因组或者扩增子分析的朋友,到了某个阶段大概率都会碰到同一个需求:样本多了,OTU表也有了,想看看物种和物种之间到底有哪些联动关系,哪些物种总是“同进同退”,哪些又是“此消彼长”。我最早做这个&am…

阅读更多 →
SoC存储体系全解析:寄存器、Cache、SRAM、DDR与Flash的分工与选型 2026/10/2 7:48:05

SoC存储体系全解析:寄存器、Cache、SRAM、DDR与Flash的分工与选型

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
SAP BAPI从原理到实战:调用技巧、性能优化与自定义开发 2026/10/2 7:48:05

SAP BAPI从原理到实战:调用技巧、性能优化与自定义开发

干这行久了你会发现,SAP系统里最值钱的东西不是那些看得见的界面,而是藏在函数库深处的那一堆BAPI。无论是做接口集成、做增强开发、还是处理那些“系统标准功能总差点意思”的业务场景,最后都得回到BAPI上来。这篇东西我酝酿了很久&#xff…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉