新闻详情

新闻详情

首页 / 资讯中心 / 详情

OCS 全光交换:TPU 集群的 3.3 倍性能,到底从哪来?

发布时间:2026/9/30 7:46:21来源:尧图网络
OCS 全光交换:TPU 集群的 3.3 倍性能,到底从哪来?
九月落幕的第27届中国国际光电博览会上光模块带宽迭代之外OCS 全光交换成了算力组网的新看点——UTStarcom 发布面向 AI 数据中心的 OCS 方案行业从技术验证走向量产落地。谷歌早已在 TPU v4 集群里引入这套全光交换架构。OCP 白皮书引用的测算显示按训练任务动态重构 TPU 集群的连接拓扑训练大型语言模型可获得 3.3 倍性能提升。这 3.3 倍来自一次清晰的分工重构两端的光模块负责收发光信号光信号全程走光纤OCS 只在网络中间层完成光路切换——不换节点上的硬件卡板不动机房里的物理光缆用软件定义的方式把固定的网络拓扑变成随任务灵活调整的动态光路。01不读数据包的交换机常规交换机的工作方式光信号进端口先转成电查完转发表决定输出端口再转回光发出去——每一跳都是一次光-电-光转换要收发、要缓存、要查表功耗和时延都花在这上面。OCSOptical Circuit Switch全光交换机把这一整套拿掉光从输入端口进来在里面只被反射、转向从输出端口出去全程以光的形式存在——没有包缓冲也没有存储转发。它更像铁路道岔而不是交换机。以量产主流的 MEMS 路线为例机器里有两组微镜阵列每片镜子都能在两个方向独立倾转一束光进来输入侧的镜子把它偏到某个方向输出侧的镜子把它接到指定端口一条光路就通了切换耗时毫秒级。谷歌 TPU 集群用的 Palomar OCS 有136×136 个端口128 个在用、8 个备用还用环形器让一根光纤同时收发两个方向端口数省了一半。正因为光只被反射、不被读取OCS 有电交换机给不了的两条特性协议无关、速率无关。光在镜子里不带任何「这是什么业务」的信息换速率、换协议OCS 本体不用动。02四千块卡怎么连线先看谷歌 TPU v4 Tensor Processing Unit v4 第四代张量处理单元 超级集群的规模64 个 Cube3D立方体单元每个 Cube 里 64 颗 TPU 排成 4×4×4 的立方体共4096 颗。每个 Cube 六个面各引出 16 条链路相对的两个面成对接到48 台 OCS上三个维度各 16 台。这些卡之间怎么互连不再由布线一次性定死而是交给 OCS 决定。一条链路的完整路径值得看一遍图 1TPU 托盘前面板的笼子里插着光模块电信号进模块转成光光纤把光送到 OCS微镜转向后接进另一条光纤回到对端光模块转回电信号进 TPU。中间没有任何电交换环节——「全光」两个字的本义。这条路径对光模块从业者的另一层含义第 4 节展开。▲ 图 1 一条光路的完整路径再看账面OCS 连同配套的光模块、光纤占系统总成本不到 5%、总功耗不到 3%。谷歌把 Jupiter 网络的 spine 层换成 OCS 后整个网络的功耗降低 41%、建设成本降低 30%——这是量产部署的数据。03三倍性能从哪来「可重构」是关键。静态网络的拓扑布好就固定了训练任务却各有各的互连形状——谷歌的切片规模小任务 4 颗 TPU 就能开大任务配到 2048 颗——加上集群里总有卡在维修静态配置只能削足适履。OCS 的做法是按任务组网训练开始前调度系统按任务需要的互连形状下发配置微镜各就各位把光路接成任务要的形状任务结束光路重新组织交给下一个任务。OCP 白皮书引用的测算很直接同一批 TPU v4 跑大模型训练按任务动态重构拓扑比静态配置提升 3.3 倍性能、降低 9% 功耗。可用性的例子更好懂图 2服务器可用度按 99.9% 算1024 颗 TPU 的切片里几乎必然有几颗是坏的——静态拓扑只能拿到25%的有效吞吐可重构的 OCS 把坏卡隔离、光路绕行重接能拿到75%。大模型训练平均只用到约六成峰值算力网络层面的按需重构正是补这块缺口的一条解法。▲ 图 2 99.9% 可用度下 1024 颗 TPU 切片的有效吞吐04省什么、不省什么对建网络的人OCS 一项很实际的价值是代际兼容镜子不认速率交换侧从上一代光模块换成下一代OCS 本体和光纤原样保留网络翻新只动一半。对做光模块的人要点更直接——OCS 不省光模块。光路两端依然是模块收发TPU 侧的模块照插在托盘前面板一颗不会少省掉的是交换机侧每一跳的光-电-光转换和配套的电交换芯片。局限同样清楚OCS 接通的是点对点电路接上就保持占用不能像分组交换那样按包扇出——它适合流量可以提前调度的大模型训练不适合突发难料的业务流量运行中重新配置要几秒没有 QoS 与遥测光每过一台 OCS 都有插损实用部署一两跳封顶再多就得加光放大补损耗。05写在最后2026 年 4 月OCP 发布 OCS 白皮书把 OCS 定调为超大规模数据中心网络的基石技术之一——它已从谷歌一家的内部实践走进整个产业的工具箱。路线上除 MEMS 外还有机械式、液晶、压电、硅光 MZI、超构表面五条切换速度从秒级到纳秒级不等各有取舍。国内也在推进2026 年 9 月的中国光博会CIOE上UTStarcom 发布了面向 AI 数据中心的 OCS 方案OCS 整机商芯信光完成数千万元 Pre-A 轮融资。对光模块行业这个趋势的读法一句话就够交换的方式在变光的收发不变——每次换路两端的模块都在位。这也是这个系列始终盯住模块两端的原因。作者声明仅为行业观测不构成采购或投资建议。
网站建设高端定制企业官网
RELATED

相关资讯

更多精彩内容,欢迎继续阅读

较早相关资讯

最新相关资讯

2026亚马逊加拿大站|电子产品上架合规检测报告大全 2026/9/30 13:52:08

2026亚马逊加拿大站|电子产品上架合规检测报告大全

2026亚马逊加拿大站|电子产品上架合规检测报告大全(无线/有线/锂电/电源)做亚马逊加拿大站的卖家都深有体会:电子产品是审核最稳、下架最快的类目。很多人习惯性用美国站 UL、FCC 报告直接上架加拿大站,结果&#xff1…

阅读更多 →
如何给DSH小鲸鱼挂件贡献代码:分支策略、Issue与PR规则的完整指南 2026/9/30 13:51:26

如何给DSH小鲸鱼挂件贡献代码:分支策略、Issue与PR规则的完整指南

如何给DSH小鲸鱼挂件贡献代码:分支策略、Issue与PR规则的完整指南 【免费下载链接】DeepSeek-Balance-Whale-Widget DeepSeek Harness(DSH)一只住在 DSH 界面右下角的小鲸鱼娘,帮你盯着DeepSeek账户余额。QQ弹弹,支持拖…

阅读更多 →
【NLP】大模型长文本处理技术与GLM-4-Plus评测:从上下文窗口到TaoToken统一调用 2026/9/30 13:51:19

【NLP】大模型长文本处理技术与GLM-4-Plus评测:从上下文窗口到TaoToken统一调用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

阅读更多 →
【Linux指南】动静态库系列(九):动态库如何进入进程地址空间:从磁盘 .so 到共享内存映射 2026/9/30 13:51:06

【Linux指南】动静态库系列(九):动态库如何进入进程地址空间:从磁盘 .so 到共享内存映射

文章目录一、动态库为什么比静态库更常用二、动态库也是文件三、动态库加载的整体流程四、从磁盘 .so 到物理内存五、从物理内存到进程虚拟地址空间六、多个进程如何共享同一个动态库七、共享的是代码,不是什么都共享八、为什么动态库加载地址不固定九、使用 /proc …

阅读更多 →
PSE认证证书有效期多久,产品改款后是否需要重新做认证? 2026/9/30 13:50:59

PSE认证证书有效期多久,产品改款后是否需要重新做认证?

PSE并不是一张所有产品都按统一年限有效的“永久证书”。需要先区分产品是否属于特定电气用品,以及企业持有的是符合性检查证书、检测报告还是其他合规文件。产品改款后,也不能仅凭外观变化判断是否需要重新认证,关键要看改动是否影响安全结构…

阅读更多 →
企业级AI知识库建设实战:从RAG架构到混合检索与元数据治理 2026/9/30 13:50:45

企业级AI知识库建设实战:从RAG架构到混合检索与元数据治理

开头今年上半年,我们海博团队在推进 AI-Native 研发体系的时候,发现一个特别扎心的事实:模型能力早就不是瓶颈了,真正卡住团队进度的是知识底座。代码仓库里那些散落的决策文档、写了没人看的架构说明、只有某个老员工脑子里的业务…

阅读更多 →

今日资讯

本周资讯

本月资讯

看完文章仍有疑问?

联系尧图顾问,获取一对一建站咨询

立即免费咨询 📞 400-888-8888
📞 ✉