新闻详情

新闻详情

首页 / 资讯中心 / 详情

智算网络技术导论:第三部分工程实践 如何建设一张智算网络

发布时间:2026/9/27 11:23:29来源:尧图网络
智算网络技术导论:第三部分工程实践 如何建设一张智算网络
第三部分 工程实践:如何建设一张智算网络第九章 规模测算方法前两部分建立了概念与结构。本部分转入工程实施,从最基础的工作开始——把一个"多少卡"的需求,逐步转化为设备数量、机柜数量、供电容量与投资估算。9.1 从卡数到设备台数的推算方法设备数量推算遵循四个步骤,其数学基础已在6.4节给出:确定单卡带宽与端口速率,得到每台Leaf可接入的卡数(k);计算 Leaf 台数:N =卡数÷ k;计算上行端口总数:N × k;计算 Spine 台数:上行端口总数÷单台Spine端口数。同时需用6.4节的判据校验规模是否超限:卡数≤端口数²。9.2 2048 卡 POD 的完整测算示例以单卡400G、Leaf采用32下行+ 32上行、1:1无收敛为设定条件,测算过程如下:第一步:2048 ÷ 32 =64 台 Leaf;第二步:64 × 32 =2048 个上行端口;第三步:2048 ÷ 64 =32 台 Spine(按64端口机型计算);第四步:校验判据。64² = 4096 ≥ 2048,满足,且余量为两倍,可扩展至4096卡而无需改变架构。图112048卡POD组网测算这一测算结果解释了三个工程事实:为什么2048卡成为默认POD尺寸(两层即可支撑且留有扩展余量);为什么万卡集群必须引入Core层(2048 × 5 = 10240 4096);为什么十万卡集群需要更复杂的拓扑(规模远超两层CLOS上限)。9.3 光模块用量测算光模块的用量与连接关系一一对应。仍以2048卡POD为例:连接位置数量说明GPU 网卡侧2048 只每张卡 1 个光口Leaf 上行2048 只64 台 × 32 个上行口Spine 下行1024 只32 台 × 32 个下行口(每端口与一台 Leaf 相连)合计约 5120 只按800G模块每只约16W估算,仅光模块自身的功耗即达到约82kW。第14章将说明这一数量在投资结构中所占的比重。9.4 机柜、供电与散热的配套测算网络设备之外,机房侧的配套测算同样需要给出,且存在几个容易出错的环节。机柜数量。按4台服务器每柜计算,2048卡(256台8卡服务器)需要约64个算力机柜;网络设备集中部署时,64台Leaf按每柜8台计算需要约8个网络机柜。整个POD规模约72个机柜。功率测算的注意事项。机柜功率不能按设备额定功率直接相加。实际计算需包含三部分:加速卡与CPU的实际运行功耗、电源模块的转换损耗、以及网卡与交换机的功耗。在此基础上还需预留约10%的冗余。散热方案的临界点。风冷机柜的散热能力上限约为25至30kW。长期接近该上限运行会导致设备降频,进而影响算力输出。单柜功率超过 32kW 时必须采用液冷方案,这在高密度算力机柜中已是普遍情况。网络设备自身的功耗。一项容易被忽略的数据:网络设备自身的功耗占集群总功耗的 10% 至 15%。在十万卡级集群中,这意味着十余兆瓦的功耗由交换机与光模块消耗,也是液冷方案被推向光模块的原因。9.5 三档规模的工程特征不同规模的集群在工程性质上存在跃迁,可用三档来描述:规模档位机柜数量总功耗拓扑结构隔离域数量千卡级约 32 个约 1.3MW两层 CLOS1 个 POD万卡级约 313 个约 12.5MW三层 CLOS ,约 700 台交换机约 5 个 POD十万卡级约 3125 个约 125MWDragonfly+ 或多平面约 49 个 POD图12三档建设规模的工程特征上表按冷板液冷、32卡每柜、单柜40kW工程预留估算。三档规模的工程性质可概括为:千卡级属于项目,万卡级属于工程,十万卡级属于基建。术语解释:POD 隔离域POD是智算集群中的一个部署单元,其规模通常定为2048卡。之所以以此划分,原因有二:其一,大模型训练的常用并行规模落在此范围内,一个训练任务可完整位于单个POD内,无需跨域通信;其二,故障影响范围(爆炸半径)可控——单个POD内出现故障时,其他POD的任务不受影响。9.6 投资结构万卡级集群的投资结构大致如下:投资项占比算力板卡约 55%机房与供配电约 15%光模块约 9%存储设备约 8%制冷与液冷约 7%交换机约 2%布线约 1.5%其他约 2.5%图13万卡集群投资结构占比这一结构包含两个反直觉的结论:结论一:光模块的投资是交换机的 4.5 倍。网络相关三项(光模块、交换机、布线)合计约占12.5%,其中光模块一项即占9%。这解释了为什么在第14章讨论光互联时,技术演进的经济动因如此强烈——降本的核心环节在光模块,而非交换机。结论二:网络投资占比虽小,但具有一票否决性质。如3.4节所分析,若网络效率减半,占投资55%的算力板卡中将有一半沦为低效资产。因此评估网络方案时,不能仅比较设备报价,而应评估其能够支撑的算力利用率。9.7 本章要点设备数量推算遵循"卡数→ Leaf台数→上行端口数→ Spine台数"四步,并用端口数平方判据校验;2048卡POD的标准配置为64台Leaf加32台Spine,配套光模块约5120只;机柜功率不可按额定值直接相加,须计入转换损耗并预留冗余;单柜超过32kW必须采用液冷;网络设备自身功耗占集群总功耗的10%至15%;千卡、万卡、十万卡三档规模的工程性质依次为项目、工程、基建;光模块投资约为交换机的4.5倍,是网络侧降本的核心环节。第十章 无损网络原理第一章与第三章建立了两个前提:训练流量对丢包的容忍度极低,而以太网本身是会丢包的。本章讨论这一矛盾的技术解法,以及为什么这些解法在实践中难以调好。10.1 根本矛盾RDMA(Remote Direct Memory Access,远程直接内存访问)是分布式训练中卡间通信的底层传输技术。其设计假设是数据包一定能够到达——一旦发生丢包,接收端不会像TCP那样进行平滑的重传与拥塞窗口调整,而是触发传输层的异常处理流程,导致整个传输停顿。这一假设与以太网的现实存在直接冲突。以太网交换机的缓冲区容量有限(通常为几十兆字节),当瞬时流量超过端口速率时,超出的部分只能丢弃。如3.3节所述,训练流量存在微突发与Incast汇聚,正是最容易触发缓冲区溢出的场景。因此,无损网络的全部技术手段,本质上都是在网络侧人为制造"不丢包"的条件,使RDMA的假设得以成立。这一目标不是通过增加缓冲区实现(缓冲区增长永远追不上突发强度),而是通过在缓冲被填满之前就抑制发送方的速率来实现。10.2 技术路线选择:RoCEv2 与 InfiniBand实现RDMA传输有两条路线:对比维度InfiniBandRoCEv2 以太网
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

10年实战:dedecms建设慕课网站完整流程与SEO破局指南 2026/9/27 12:13:44

10年实战:dedecms建设慕课网站完整流程与SEO破局指南

10年实战:dedecms建设慕课网站完整流程与SEO破局指南 网站做好了没人访问,这是无数站长和开发者最头疼的噩梦。你花了几周时间,用 DedeCMS…

阅读更多 →
2026最新美业网站建设避坑指南:不会代码也能搞定 2026/9/27 12:13:31

2026最新美业网站建设避坑指南:不会代码也能搞定

2026最新美业网站建设避坑指南:不会代码也能搞定 自己不会代码想做网站?别慌,这是很多美业老板和独立站长的真实写照。过去大家总以为建站必须懂前端后端,其实2026年的技术栈已经彻底降低了门槛。…

阅读更多 →
帝国cms如何做网站详细步骤 2026/9/27 12:13:25

帝国cms如何做网站详细步骤

不会代码想做网站?帝国CMS建站实操与SEO对比评测指南 想做个网站却看不懂一行代码,是不是心里直打鼓?别慌,很多做企业站的朋友起初都卡在这。 其实选对工具,不用背代码也能把站搞起来,还能让百度和谷歌搜得到。…

阅读更多 →
3个避坑要点:软件工作室网站模板选择注意事项 2026/9/27 12:13:12

3个避坑要点:软件工作室网站模板选择注意事项

3个避坑要点:软件工作室网站模板选择注意事项 找建站公司报价虚高,模板套用又担心同质化?别急。很多新手刚入行做软件工作室官网,第一反应就是找外包,结果报价单拿过来一看,基础版都要大几千,定制开发更是无底洞。其实,对于初期阶段的小型软件工作室…

阅读更多 →
外贸平台有哪些国际避坑指南:老手揭秘选站与防黑实操 2026/9/27 12:12:09

外贸平台有哪些国际避坑指南:老手揭秘选站与防黑实操

外贸平台有哪些国际避坑指南:老手揭秘选站与防黑实操 上周长沙一家做五金出口的老板深夜给我打电话,声音都在抖。他说自己花了八千块做的官网,第二天打开全是赌博广告,后台密码全被改,客户邮件收不到,直接损失了三个意向单。他问我:“网站被黑挂马不知…

阅读更多 →
做众筹的网站有几个?实战案例拆解避坑指南 2026/9/27 12:11:51

做众筹的网站有几个?实战案例拆解避坑指南

做众筹的网站有几个?实战案例拆解避坑指南 找建站公司最怕什么?怕被坑高价,更怕花大钱买了个半成品。很多老板问【做众筹的网站有几个】核心功能模块,往往被销售忽悠得云里雾里。我见过太多【实战案例】,老板以为众筹就是加个支付按钮,结果上线后资金对…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉