新闻详情

新闻详情

首页 / 资讯中心 / 详情

AISystem 硬核拆解:NVSwitch 深度解析——从无阻塞全互联到 SHARP 硬件加速

发布时间:2026/10/2 8:13:01来源:尧图网络
AISystem 硬核拆解:NVSwitch 深度解析——从无阻塞全互联到 SHARP 硬件加速
文档教程人工智能【免费下载链接】AISystemAISystem 主要是指AI系统包括AI芯片、AI编译器、AI推理和训练框架等AI全栈底层技术项目地址https://gitcode.com/GitHub_Trending/ai/AISystem点击查看免费下载本篇是《AISystem》开源课程「英伟达 GPU 详解」系列02Hardware/04NVIDIA的核心篇章承接 分布式通信与 NVLink 与 NVLink 原理剖析聚焦英伟达多 GPU 互联的关键枢纽——NVSwitch。读完你将掌握NVSwitch 为何能突破 PCIe 与直连 NVLink 的带宽瓶颈、从 Volta 到 Hopper 三代 NVSwitch 的架构与参数演进、其无阻塞全互联的硬件原理以及第三代 NVSwitch 上 SHARP 模块为集合通信带来的硬件加速价值。为什么需要 NVSwitch多 GPU 互联的瓶颈单卡算力逼近物理极限多卡协同成为必然随着 AI 与机器学习对算力需求的爆发式增长单个 GPU 的计算能力逐渐逼近物理极限。单纯堆叠单卡算力已不可行多 GPU 协同工作成为满足大规模训练需求的必然选择——无论是数据并行还是模型并行都需要 GPU 之间频繁、高效地交换数据和同步参数。PCIe 的带宽天花板在 NVLink 出现之前GPU 之间的通信主要依赖 PCIe 总线。如上图所示一个 GPU 若要访问另一张 GPU 的 HBM2 高带宽内存数据必须经过 PCIe 接口。PCIe 3.0 每个通道双向带宽约 32GB/s与 GPU 内部动辄数 TB/s 的 HBM 带宽相比差距悬殊PCIe 的带宽与延迟成为 GPU 间通信的典型性能瓶颈GPU 在处理完当前数据后往往要等待下一批数据到达导致计算效率显著下降详见 NVLink 原理剖析 中PCIe 与 GPU 关系一节。NVLink 直连绕过 CPU 的 GPU 间高速通道为克服这一瓶颈英伟达开发了 NVLink——一种带宽约为 PCIe 十倍的点对点高速互连技术允许单个服务器内的 8 个 GPU 通过点对点网络连接成混合立方体网格hybrid cube mesh。NVLink 的核心优势在于绕过 CPU 分配与调度机制GPU 之间可直接交换数据减少传输延迟大幅提升系统吞吐量直接访问卡间 HBM通过 NVLink GPCs 可以直接访问其他 GPU 内的 HBM2 内存数据无需数据先落地系统内存起到 XBAR交叉开关的桥梁作用作为不同 GPU 之间的桥接器允许数据在 GPU 间自由流动与 PCIe 互补共存NVLink 巧妙避开与 PCIe 总线的冲突NVLink 承担高速 GPU 间通信PCIe 承担 GPU 与 CPU、存储等外设的通信二者可共存于同一系统。然而NVLink 的点对点直连在多 GPU 规模扩大后仍有局限当 GPU 数量增多时任何两点间的通信可能需要中间 GPU 跳数且直连拓扑的总带宽受限于单条链路的 Gang 分组。NVSwitch 正是在此基础上进一步发展——通过提供更多 NVLink 接口、无需任何中间 GPU 跳数实现完全无阻塞的全互联 GPU 系统支撑更大规模的 GPU 集群。NVSwitch 的出现与代际演进从 Pascal 的 NVLink 到 Volta 的 NVSwitch英伟达在 Pascal 架构P100中首次引入 NVLink开辟了 GPU 间高速通信的新通道。真正的技术飞跃发生在下一代 Volta 架构中——伴随 NVSwitch 的诞生。NVSwitch 如同一座架设在数据传输网络中的智能枢纽支持更多 NVLink 链路允许多个 GPU 全互联极大优化了数据交换的效率与灵活性。三代 NVSwitch 的核心演进从 Volta 到 HopperGPU 间通信带宽从 300GB/s 提升至 900GB/s其背后是 NVLink 链路数的显著提升Volta 6 路 → Hopper 18 路如同一段高速公路不断增设立交桥与环岛使数据流高效穿梭于各 GPU 之间。四代 DGX 服务器中 GPU 与 NVSwitch 的互连架构演进如下图DGX-1P100——纯 NVLink 直连时代8 张 GPU 卡每卡支持 4 条 NVLink 链路组织成两个 cube meshGPU 0~3 与 GPU 4~7。cube 内部 GPU 可直接通过 NVLink 或 PCIe Switch 通信跨 cube 通信如 GPU 0 与 GPU 4则必须经其他 GPU 间接转发存在跳数。DGX-2V100——第一代 NVSwitch每张 GPU 支持 6 条 NVLink 链路不再是 4 条引入 6 个 NVSwitch 将服务器内全部 GPU 卡互联支持 8 对 GPU 同时通信不再需要任何中间 GPU 跳数实现直接高速通信。DGX-A100——第二代 NVSwitch提供更高通信带宽与更低延迟。A100 每卡支持 12 条 NVLink第三代链路通过 6 个 NVSwitch 实现全连接网络拓扑。标准 DGX A100 配置包含 8 块 GPU 卡且系统可扩展更多 A100 与 NVSwitch 以构建更大规模超级计算机。DGX-H100——第三代 NVSwitch 第四代 NVLink每卡支持 18 条 NVLink 链路引入 4 个 NVSwitch 并采用分层拓扑——每张卡向第一个 NVSwitch 接入 5 条链路、第二个 4 条、第三个 4 条、第四个 5 条共 72 个 NVLink 提供 3.6 TB/s 全双工 NVLink 网络带宽比上一代提升 1.5 倍。值得注意的是DGX H100 中留出的 72 个 NVLink4 连接还可通过 NVLink-Network Switch 连接其他 DGX H100 系统组建 DGX H100 SuperPod详见 分布式通信与 NVLink 的NVSwitch 发展一节。NVSwitch 详解初代 NVSwitch无阻塞全互联的基石NVSwitch 的设计目标是为英伟达打造一个完全无阻塞的全互联 GPU 系统。第一代 NVSwitch 支持 18 路接口可支持多达 16 个 GPU 的全互联。在 V100 架构中每块 GPU 拥有 6 条 NVLink 通道连接 NVSwitchDGX-2 系统中 8 个 V100 GPU 通过 NVLink 通道与 6 个 NVSwitch 相连构建成强大的基板初代 NVSwitch 的关键参数如下表所示表格源自 NVSwitch 参数规格图 06DeepNvswitch06.png参数项规格支持的 NVLink 版本NVLink 2.0每个接口通道数双通道每 NVLink 双向带宽50GB/s实际利用率最高可达 80%系统总带宽900GB/s制造工艺台积电 12nm FinFET FFN功耗100W晶体管规模约 2 亿个封装形式大型 BGA 芯片共 1940 个引脚NVLink 专用引脚576 个支持 18 路 NVLink其余引脚用途电源、x4 PCIe 管理端口、I2C、GPIO 等初代 NVSwitch BlockGPU XBAR 与物理内存共享GPU XBAR对外呈现为单个 GPU 的桥接器NVSwitch 内部的核心模块是 GPU XBAR——一个高度专业化的桥接设备专为 NVLink 互连环境设计。它使数据包能够在多个 GPU 之间流动和交换同时对外呈现为单个 GPU。通过 GPU XBAR客户端应用程序能够感知并利用多个 GPU 的集合性能显著降低了客户端进行 GPU 间通信管理的复杂性。GPU XBAR 利用基于静态随机存取存储器SRAM的缓冲技术实现非阻塞数据传输即使在高负载下也能保持数据传输的连续性与高效性从 V100 GPU 开始英伟达重新使用了 NVLink 的 IP 块和 XBAR 设计既保证了不同代产品之间的兼容性也使 NVLink 技术得以不断迭代优化同时降低了开发成本与周期。物理地址通信NVLink 传输的底层机制结合整个 GPU 来看 NVSwitch 与 GPU 之间的数据传输分发机制在编程中开发者通常处理的是虚拟地址——由操作系统管理与抽象为不同程序提供独立地址空间而物理内存中数据实际以物理地址存储虚拟地址到物理地址的转换通常由 GPU 核心或固定功能单元如 MMU 内存管理单元完成。通过 NVLink 传输数据时使用的是物理地址而非虚拟地址。原因在于物理地址直接指向数据的实际存储位置加快数据的索引与访问速度NVSwitch 作为 NVLink 的桥接设备负责维护复杂的路由与缓冲机制确保数据包按照正确物理地址快速、准确地送达目的地使用物理地址可减少目标 GPU 上进行地址转换的需要从而降低延迟、提高传输速率。这一机制对于需要快速处理大量数据的高性能计算和 AI 应用至关重要。NVSwitch 简化原理与特性无 NVSwitch 的直接 GPU 间连接在没有 NVSwitch 的配置中GPU 之间的连接通常通过将 NVLinks 聚合成多个组Gang实现——多个 GPU 共享 NVLink 链路通信。其限制在于任意两个 GPU 之间的最大带宽受限于它们所在 Gang 的 NVLink 数量与带宽无法自由伸缩引入 NVSwitch 后的改进NVSwitch 作为一个高速交换机允许所有链路上的数据自由交互。在 NVSwitch 架构中任意一对 GPU 都可以直接互联只要不超过六个 NVLink 的总带宽单个 GPU 的流量即可实现非阻塞传输全互联架构意味着系统可轻松扩展以支持更多 GPU 而不牺牲性能。NVSwitch 在解决多 GPU 互联上的核心优势与特性扩展性与可伸缩性通过简单添加更多 NVSwitch系统可轻松支持更多 GPU扩展计算能力。高效的系统构建例如 8 个 GPU 通过 3 个 NVSwitch 即可构建成高效互连网络数据在所有 GPU 链路间自由交互。全双向带宽利用任意一对 GPU 都能利用完整的 300GB/s 双向带宽进行通信对应初代 NVSwitch 时代实现高速、低延迟的数据传输。无阻塞通信NVSwitch 中的交叉开关XBAR为数据传输提供从点 A 到点 B 的唯一路径确保通信过程无阻塞、无干扰提升可靠性。优化的网络拓扑NVSwitch 支持的网络拓扑为构建大型 GPU 集群提供优化方案系统设计者可根据计算需求灵活配置 GPU 间的连接方式。第三代 NVSwitchSHARP 硬件加速与新 NVLink 模块第三代 NVSwitchNVSwitch 3.0在 Hopper 架构中登场带来了质的飞跃核心硬件参数制造工艺台积电 4N 工艺在集成大量晶体管和高带宽的同时保持较低功耗NVLink 端口64 个 NVLink 4 链路端口允许构建包含大量 GPU 的复杂网络全双工带宽3.2 TB/s显著提升大规模数据集的并行处理效率信号技术50 Gbaud PAM4 信号每个差分对提供 100Gbps 带宽兼具高速传输与低延迟特性互操作性物理电气接口与 400Gbps 以太网和 InfiniBand 兼容可与现有网络技术互通。SHARP 技术集成NVSwitch 3.0 集成了英伟达 SHARPScalable Hierarchical Aggregation and Reduction Protocol技术支持 all_gather、reduce_scatter、broadcast atomics 等集合通信操作为集群通信提供硬件加速。第三代 NVSwitch 的内部 Block 设计如下图所示新增的 SHARP 模块与 NVLink 模块为 GPU 间高效通信和数据处理带来显著提升新 SHARP 模块强大的数据处理能力支持从逻辑运算到算术运算的多种运算符兼容多种数据格式如 FP16 和 BF16为 AI 和机器学习工作负载提供有力支撑SHARP 控制器可并行管理多达 128 个 SHARP 组同时处理众多任务大幅提升数据并行处理效率NVSwitch 中的交叉开关XBAR经过精心调整优化与 SHARP 模块的数据传输需求完美匹配确保数据在 GPU 间传输的高效率与低延迟。新 NVLink 模块安全性增强为数据和芯片提供额外安全保护防止未授权访问和潜在数据泄露端口分区将不同端口隔离到单独的 NVLink 网络中允许在不同网络间实现资源逻辑分割优化多任务处理能力OSFP 电缆支持控制器支持下一代 Octal Small Formfactor PluggableOSFP电缆提供更高传输速率和更低信号衰减适合长距离高速通信为未来网络扩展提供可能遥测功能扩展使系统管理员能够更精确地监控和优化网络性能确保系统稳定运行前向纠错FEC集成 FEC 技术增强数据传输可靠性在信号衰减或干扰时保证数据完整性和准确性。与集合通信的联动NVSwitch 在 AI 训练中的价值NVSwitch 的价值最终要落到 AI 训练的软件栈上。在 分布式通信与 NVLink 中可以看到数据并行的梯度聚合依赖 All-Reduce模型并行流水并行、张量并行依赖 all-gather、reduce-scatter 等集合通信原语。这些原语通过 NCCLNVIDIA Collective Communications Library在 GPU 间执行而 NVLink/NVSwitch 正是 NCCL 底层的高带宽物理通道。NVSwitch 3.0 中 SHARP 模块的意义正在于此传统 All-Reduce 需要在节点内把数据先汇聚到某个 GPU 再分发流量大、延迟高而 SHARP 将规约与归并下沉到交换芯片内部执行GPU 只需把数据送入 NVSwitch即可由交换芯片完成部分聚合后再转发显著降低节点内通信流量与延迟。这正是AI 计算体系中通信硬件与集合通信库NCCL协同工作的典型体现也是 NVSwitch 从通道升级为算力互连基础设施的关键所在。小结与思考关键作用NVSwitch 通过提供高带宽、低延迟的多 GPU 互联解决了大规模并行计算中的通信瓶颈问题是构建 DGX 级 GPU 服务器与超级计算机的核心组件。演进脉络自 Volta 架构首次引入以来NVSwitch 已历经三代发展——从初代 18 路接口、900GB/s 系统总带宽到第三代 64 个 NVLink 4 端口、3.2TB/s 全双工带宽每代都显著提升了 GPU 间的通信能力。技术特性NVSwitch 支持全互联架构具备高度系统扩展性与灵活性集成的 SHARP 与 NVLink 模块增强了数据处理能力与安全性为高性能计算和 AI 应用提供了坚实基础。延伸阅读本文属于《AISystem》「英伟达 GPU 详解」系列02Hardware/04NVIDIA的 NVSwitch 篇章建议按顺序阅读同目录下的 Tensor Core 原理上、Tensor Core 架构中、Tensor Core 剖析下、分布式通信与 NVLink 与 NVLink 原理剖析若希望从更大视角理解 GPU 在 AI 全栈中的地位可继续阅读 02Hardware 硬件体系总览 及 AI 芯片黄金十年。赞分享文档教程人工智能【免费下载链接】AISystemAISystem 主要是指AI系统包括AI芯片、AI编译器、AI推理和训练框架等AI全栈底层技术项目地址https://gitcode.com/GitHub_Trending/ai/AISystem点击查看免费下载相关推荐无线CarPlay适配器深度解析从硬件拆解到固件定制无线CarPlay适配器深度解析从硬件拆解到固件定制 还在为有线CarPlay的连接不便而烦恼吗无线CarPlay适配器正是解决这一痛点的完美方案。本文将带逆向工程固件嵌入式HoloCubic硬件设计终极指南从PCB原理图到元器件选型全解析HoloCubic硬件设计终极指南从PCB原理图到元器件选型全解析 HoloCubic是一款基于ESP32 PICO D4的 伪全息透明显示桌面站 它巧妙利嵌入式物联网智能硬件嵌入式GUI硬件开发mpv硬件加速全解析NVENC、VAAPI、VDPAU深度优化mpv硬件加速全解析NVENC、VAAPI、VDPAU深度优化 引言为什么需要硬件加速 在视频播放领域硬件加速Hardware Acceleratio音视频视频音频上一篇QMCDecode终极指南3步解锁QQ音乐加密格式让付费音乐真正属于你下一篇OnmyojiAutoScript阴阳师自动化脚本终极指南3步解放你的游戏时间创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

AI 原生开发到底是什么?跟用 Copilot 写代码完全是两码事|TaoToken 统一 Key 通道实测 2026/10/2 12:28:19

AI 原生开发到底是什么?跟用 Copilot 写代码完全是两码事|TaoToken 统一 Key 通道实测

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Claude Code接入阿里云百炼:TaoToken统一Key配置与验证 2026/10/2 12:28:19

Claude Code接入阿里云百炼:TaoToken统一Key配置与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
Codex CLI 使用指南:把 auth.json 改到 TaoToken 的完整配置流程 2026/10/2 12:28:19

Codex CLI 使用指南:把 auth.json 改到 TaoToken 的完整配置流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
以Trae IDE为例,拆解大模型、MCP与Agent的协作链路:TaoToken统一Key接入实操 2026/10/2 12:28:19

以Trae IDE为例,拆解大模型、MCP与Agent的协作链路:TaoToken统一Key接入实操

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
【堆】LC 215.数组中的第K个最大元素 2026/10/2 12:28:19

【堆】LC 215.数组中的第K个最大元素

文章目录前言一、题目1、原题链接2、题目描述二、个人思路整理1、思路分析思路1:快速选择思路2:小顶堆2、解题代码思路1:快速选择思路2:小顶堆三、知识风暴前言 本专栏文章为《LeetCode 热题 100》的刷题题解,相关内容…

阅读更多 →
Vue 3与Svelte用户福音:theSVG类型化组件接入实战指南 2026/10/2 12:28:12

Vue 3与Svelte用户福音:theSVG类型化组件接入实战指南

Vue 3与Svelte用户福音:theSVG类型化组件接入实战指南 【免费下载链接】thesvg 7,400 brand SVG icons for developers. Tree-shakeable, typed, open source. npm i thesvg 项目地址: https://gitcode.com/gh_mirrors/th/thesvg theSVG 是一个开源的 SVG 品…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉