拓冰建站拓冰建站
首页 / 资讯中心 / 正文

InfiniBand网络全解析:从产品代际到实战部署避坑

聊起InfiniBand搞AI训练的人会本能地把它和“顶级算力集群”绑在一起搞网络运维的人则会想起被端口速率、散热风扇和子网管理器支配的深夜。这两年大模型把行业卷得厉害几乎所有头部算力集群公布规格时都少不了巨量InfiniBand互联的提法但真正亲手搭过、调过、排障过这套网络的人依然不多。这篇文章我想从一个经历过多代IB产品的从业者角度把主流厂商格局、产品代际、选型逻辑和落地部署的坑一次讲透给正在纠结“要不要上IB、怎么上IB”的人一份能直接参考的实战记录。我尽量不去复述厂商发布会PPT里那些漂亮话而是讲清楚每一代产品解决了什么问题、为什么这个市场最后只剩一家玩家、以及你在实际采购和运维时最容易踩的点。如果你对IB只有一个模糊的概念看完应该能建立起完整的技术判断框架如果你已经在维护IB网络后面的排障和调优部分应该也能给你一些启发。1. 先别被参数吓到InfiniBand究竟解决什么问题1.1 传统以太网在AI/HPC场景里的尴尬要理解InfiniBand最好先理解它对标的痛点。早期数据中心大多用的是普通以太网服务器之间通信依赖TCP/IP协议栈。TCP/IP设计的出发点是“在不可靠链路上可靠传输”所以它做了大量校验、确认、重传、窗口调优的机制。这些机制在普通网页访问、文件共享场景下没问题因为单次请求的数据量不大几十微秒的延迟增加几乎感觉不到。但到了高性能计算和AI训练场景情况完全不同。一个GPU节点要在训练过程中频繁向其他几百个节点发送参数梯度通信模式是多对多、周期性的数据量动辄几十GB。传统TCP/IP的问题立刻暴露CPU要深度参与协议处理中断和拷贝开销巨大一旦网络出现瞬时拥塞丢包后触发TCP重传时延可能从微秒级直接飙升到毫秒级而且TCP的拥塞控制是端到端的推断式控制永远滞后于真实网络状态。说白了以太网像是城市通勤道路设计时先保证“能走”没考虑“高峰期全部车同时上路还要不堵”。我在刚开始管理AI集群时听开发抱怨最多的一句话是“GPU利用率上不去”。后来一查瓶颈根本不在显卡而在网卡和协议栈。一千张GPU卡之间彼此通信汇聚带宽需求惊人普通千兆或万兆以太网根本扛不住哪怕上了25G/100G以太网TCP的协议开销依然会吃掉很大一部分有效吞吐。1.2 InfiniBand的设计思路是用专用公路替换通用公路InfiniBand的思路和以太网完全不同。它从设计第一天起就不是“通用网络”而是面向高性能计算和存储互联的专用网络。它是起源自1999年一项由Intel、Compaq、HP等公司推动的I/O总线标准后来逐渐演变成真正的网络技术。核心设计有几个关键词高带宽、低延迟、低CPU占用、无损传输。实现这些目标依赖几个底层机制。第一个是内核旁路Kernel Bypass。普通网络数据要读取需要从网卡到内核缓冲区再到用户应用中途经过协议栈、内存拷贝、系统调用而InfiniBand允许应用直接和网卡交换数据通过“队列对”Queue PairQP机制完成发送接收CPU几乎不参与数据通路。第二个是基于信用的流控机制。它不像TCP那样靠丢包来判断拥塞而是逐跳hop-by-hop用信用额度控制发送端只有在确认对端有足够缓冲区后才发送数据从机制上避免了丢包。第三个是RDMA也就是远程直接内存访问数据可以从一台机器内存直接搬到另一台机器内存不需要双方操作系统的介入。用一个生活化类比以太网像普通公路路上有红绿灯、有各种社会车辆堵车时所有车一起减速。InfiniBand更像一条为特定车队封闭的高速专用道专车直达、全程没有红绿灯连收费站都是自动扣费。这套机制带来的实际效果是端到端延迟可以做到亚微秒级CPU占用率大幅下降带宽利用率能跑到90%以上而传统以太网在相同压力下很容易掉到70%以下。2. 厂商格局解读NVIDIA独占之后其他人为什么不跟了2.1 一场并购重塑了整个InfiniBand生态现在聊InfiniBand厂商绕不开NVIDIA。但在十多年前这个赛道远不止一家。早期的InfiniBand市场有Mellanox、Voltaire、QLogic、Intel等多家互相竞争其中Mellanox逐渐把产品和生态做起来了旗下有ConnectX系列网卡、Quantum系列交换机、LinkX系列线缆光模块几乎覆盖整个IB网络栈。真正让Mellanox封神的是它在RDMA、GPUDirect RDMA这些技术上的提前布局和英伟达GPU一起在HPC和后来的AI浪潮中形成了很深的绑定。2020年4月NVIDIA以近70亿美元完成对Mellanox的收购这在当时是数据中心领域震惊业内的一笔交易。很多人只把它理解成“NVIDIA买了一家网卡公司”但实际操作中这笔收购的意义是把“GPU算力”和“高速网络”整合成了一套整体方案。NVIDIA并没有搅乱Mellanox的产品线反而把IB深度融入自己的DGX/HGX整机系统让InfiniBand从可选组件变成了很多AI集群的标准配置。你可以说这是商业策略也可以说是生态绑定但它客观上让IB的技术迭代节奏和GPU迭代挂上了钩GPU算力翻倍网络必须同步升级。2.2 其他老玩家的退场是自然淘汰还是无奈再看看那些已经退场的名字。Intel早期也做IB交换机后来把重点转向了自研的Omni-Path互连技术想用更低的成本抢占HPC市场。Omni-Path早期在部分超算里确实有部署但生态一直没做起来软件兼容性、集群规模支撑能力都不如IB最终被NVIDIA收购Mellanox之后的那一轮竞争彻底边缘化后来Intel自己也宣布停止Omni-Path研发。QLogic曾经收购了InfiniPath和TrueScale相关技术但也只停留在部分区域市场最终没有形成气候。Voltaire是做IB交换机名气不小的一家2011年被Mellanox直接收购。还有更早的QsNet、Infinicon等基本都消失在了行业整合中。这个赛道出现“赢家通吃”有几个现实原因。第一是技术壁垒太高。IB是端到端的整体方案物理层、链路层、网络层、传输层全部由一套协议栈统一定义而且要做自适应路由、拥塞控制、基于信用的无损传输、子网管理等复杂功能新玩家想切入必须同时搞定芯片、固件、驱动、管理软件成本和周期远超一般网络产品。第二是生态绑定太深。IB的优势不只在硬件CUDA生态、GPU Direct技术、NVIDIA的集合通信库NCCL都和它深度配合第三方厂商很难复制这一整套协同优化的效果。第三是市场盘子不算大。相比全球庞大的以太网市场IB是相对垂直的细分领域后来者投入同样的研发经费很难在AI和HPC之外看到足够的回报。现在业界甚至有一个有点夸张的说法InfiniBand基本等于NVIDIANVIDIA就是InfiniBand。虽然不完全准确但也反映现实。如果你打开采购清单HCA网卡是ConnectX系列交换机是Quantum系列线缆是LinkX系列管理软件是UFM几乎清一色都是同一家。2.3 NVIDIA当前产品矩阵一览梳理当前NVIDIA侧主流InfiniBand产品可以从三个维度看网卡、交换机和线缆。网卡这边ConnectX系列是核心。ConnectX-5比老一代EDR网络有了明显提升后来在性价比市场还推出过支持HDR100的版本ConnectX-6把速率推到HDR 200Gb/s支持RDMA、NVMe-oF、加密、虚拟化等功能适合主流IB接入ConnectX-7则是NDR产品单端口400Gb/s支持更强的拥塞控制和自适应路由AI集群和超算的高端节点普遍选它。它是GPU服务器里最常见的HCA之一因为一颗卡就能提供超大带宽配合GPU Direct RDMA能很好释放多卡间通信压力。交换机这边Quantum系列是IB交换机的主力。入门和中端集群可以用Quantum QM8700这个级别对应HDR 200G存储和数据中心场景都覆盖到了再往上是NDR代际的QM9700/9790系列支持400G端口高密度接入面向万卡级甚至更大规模集群。NVIDIA现在也把网络产品划分成以太网侧Spectrum系列和IB侧Quantum系列两条线后者才是今天讨论的主角。线缆和光模块则是LinkX系列铜缆DAC、有源光缆AOC、可插拔光模块都有采购时官方认证线缆的兼容性最好后面部署部分我会专门讲线缆踩过的坑。3. 产品代际横向拆解从HDR到NDR网卡和交换机怎么选3.1 一张表看懂IB核心技术路线InfiniBand从诞生到现在经历了很多代每一代都用速率翻倍的方式迭代。判断一套IB网络“是哪一年代表”的方法很简单看单端口速率和PHY层的调制方式。早期的SDR单端口10Gb/sDDR是20Gb/sQDR到40Gb/sFDR是56Gb/sEDR到100Gb/sHDR跳到200Gb/sNDR目前做到400Gb/s。每一代向下兼容但速率不同不同代际的设备混插时只能协商到低速率。实际部署中这是很多人忽视的点买了新的NDR交换机如果服务器里还是老HDR网卡最终链路只会跑在HDR速率上厂商参数表里的400G不会自动生效。把主流代际的关键参数列出来更直观代际典型单端口速率单Lane速率发布时间典型HCA典型交换机EDR100Gb/s25G约2014年ConnectX-5QM8800系列HDR200Gb/s50G约2018年ConnectX-6QM8700系列HDR500最高可达500Gb/s50G多通道增强HDR中期ConnectX-6 DxQM8790系列NDR400Gb/s100G约2022年ConnectX-7QM9700/QM9790系列XDR预计800Gb/s200G路线图阶段待发布待发布从EDR到HDR再到NDR表面上是速率翻倍更深层的变化是PAM4调制技术的引入。以前以太网和IB大多用NRZ非归零编码一个符号只能传1bit到了HDR以后PAM4一个符号能传2bit相同波特率下的吞吐直接翻倍代价是对信噪比更敏感、对线缆和光模块的要求更高。这也是为什么NDR时代的布线容错空间更小劣质线缆非常容易导致链路误码率飙升。3.2 网卡选型看什么ConnectX具体怎么挑选HCA网卡不能只看接口速率还得看PCIe通道数量、链路代际、以及是否支持你需要的功能特性。比如ConnectX-6是PCIe 4.0 x16而ConnectX-7原生支持PCIe 5.0理论接口带宽能覆盖400G的网络吞吐。实际选购时要确认服务器的PCIe插槽能支持对应的代际和lane数如果主板只有PCIe 4.0买一块PCIe 5.0的网卡也能用但通信带宽可能降一档物理速率提升带来的收益会打折扣。另外需要关注网卡的形态和端口数。ConnectX-6和ConnectX-7都有单端口和双端口版本双端口版可以用两路200G捆绑成400G也可以在两张GPU服务器间做冗余链路。对于普通训练节点双端口的HCA配一个2层IB拓扑普遍体验是单点故障少、带宽扩展灵活。还要注意网卡是否支持RoCE、NVMe-oF这些“跨界”功能。一台服务器如果既要跑AI训练又要接存储尽量选一个能同时支持IB和以太网双模式的HCA避免为不同业务准备两套网卡硬件。从成本端考虑也不需要盲目上最新一代。很多成本敏感的场景里HDR其实比NDR更划算尤其是单集群规模在128/256节点以下时HDR的200G带宽对大部分AI训练任务是够用的。上一代产品生命周期成熟驱动稳定二手和现货市场也相对充裕适合预算有限但希望体验IB性能的团队。3.3 交换机与组网拓扑不只是堆端口数IB交换机的选择核心不是单台设备端口密度而是组网后能不能满足全局通信带宽。AI训练网络最常用的组网是两层或三层的胖树Fat-Tree拓扑。两层胖树适合几百个节点以内的集群所有叶子交换机上行到同样的核心交换机带宽收敛比比如leaf和spine用相同速率端口就能做到无收敛。到了千卡以上规模通常要拉三层spine这时候交换机需要支持自适应路由、拥塞控制、以及在链路故障时快速收敛这些能力是由芯片硬件和管理固件共同决定的。NVIDIA交换机上那些“支持NDR”的指标实际能跑到多少和端口速率、内部缓存、路由算法都有关系。主流旗舰交换机单机端口密度是三四十口400G起步集群规模再大就靠级联。部署时建议按照厂商参考架构来选信不要自己拍脑袋搭非标拓扑。参考架构里的端口映射、线缆长度、SM部署方式都经过验证能少踩很多坑。4. 绕不开的对手RoCE、UEC和以太网阵营的真实差距4.1 RoCE并不是等闲之辈聊IB必然绕不开RoCERDMA over Converged Ethernet。RoCE的核心思路是能不能把RDMA这种高效率和低开销的通信方式搬到标准以太网上按照这个思路发展出的RoCEv2是目前许多互联网企业和云厂商在AI集群里大规模采用的技术。它的硬件成本比IB低底层可以复用成熟的25G/100G/400G交换机生态运维人员掌握的以太网技能也更为普及。RoCEv2要真正跑出接近IB的效果需要底层以太网无损不能有拥塞丢包。为此要配置PFC优先级流控、ECN显式拥塞通知、ETS等机制。操作上比IB要复杂得多因为PFC是逐跳作用的一个配置错误的交换机可能导致优先级阻塞扩散到整个网络。IB的设计天生就无损基于信用流控和更精细的拥塞控制在万卡规模下故障定位和调优的体验通常比RoCE更顺畅。不少从业者的经验是小规模环境里RoCE和IB差距没有想象中那么大一旦集群规模上千卡、通信模式复杂IB的稳定性和性能优势才会真正凸显。4.2 以太网阵营正在加速“围剿”近两年业界出现了一个明显动向Ultra Ethernet ConsortiumUEC成立AMD、Arista、Broadcom、Cisco、Intel、Meta、Microsoft这些主力玩家都在里面目标是把标准以太网改造成能支撑超大规模AI和高性能计算的新型网络。与此同时NVIDIA自己也推出了Spectrum-X等以太网优化方案这表明即便是InfiniBand的主导厂商也在布局以太网侧的“无损RDMA”能力。UEC如果顺利推进未来AI集群完全有可能普遍使用以太网并配合RoCE或新的传输协议满足通信需求。但技术路线从提出到标准落地再到设备大规模商业化通常会经历好几年时间而且未来即使以太网性能上升了IB多年积累的生态、工具链、自适应路由实现经验依然是它的护城河。短期内两套体系会并行很难说谁立刻吃掉谁。4.3 我的真实选型判断关于最终选IB还是RoCE我的实际标准很简单如果集群规模在几百卡以内、整体网络架构以以太网为主、供应链以传统服务器和交换机为主直接用RoCEv2往往已经够用成本还低如果目标是用几千卡跑基础大模型训练对通信延迟和可预期性要求极高且愿意为网络稳定性承担溢价那么IB依然是更省心的选择。现在市面上很多新建AI集群会直接采购NVIDIA整机柜方案而方案里网络默认就是IB这时候单独纠结“IB还是以太网”反而没有意义整机方案已经帮你把选择做完了。还有一点容易被忽略技术选型要考虑售后技能。IB网络调优和排障需要的知识体系和以太网不太一样比如要理解SM、QP、credit机制、GPUDirect配置。如果你的运维团队去过没接触过OFED和MLNX驱动贸然上IB可能会因为不会用而背上“不好用”的锅。同样RoCE的无损配置也需要较高的网络经验。先把团队能力摸清楚再选技术比单纯对比参数更实际。5. 实战部署要点一套IB集群从采购到调优避坑清单5.1 从硬件清单到组网5步搭建基础IB网络如果确定了要上IB第一步是列清单。一台训练节点通常配一张HCA网卡双端口版本接入两台不同叶子交换机。核心网络至少有两台spine交换机支撑冗余。线缆看距离机房内部1~3米可以用DAC铜缆便宜、功耗低跨机柜甚至跨机房再考虑AOC有源光缆或光模块加光纤。一定注意端口的连接器定义HDR/QDR/N端口之间不兼容线缆必须匹配这也是采购时容易出问题的地方。第二步是安装驱动和固件。官方MLNX_OFED驱动是必装的安装前先核对Linux内核版本用系统包管理器装对应版本。设置网卡IP地址时IB的IP是通过ipaddr或opensm创建的子网接口如ib0来做上层配置与传统网卡管理方式不同。装好后用ibstatus看一下链路速率和状态用ibstat查看HCA卡的具体型号、固件版本、物理端口状态确认链路处于Active而不是Init状态。第三步是规划IP和子网。IB子网编号用默认的0xfe80000000000000开头在单子网里不用改多子网互联时再做设置。每台机器通过ib0接口配置IP后续TCP服务照常跑但上层业务要走RDMA时需要知道入口在IB端口上而不是普通的eth0。第四步是部署子网管理器。IB网络必须有至少一台机器运行SMSubnet ManagerSM负责计算路由、分配LID地址、检测链路状态。生产环境强烈建议跑双SM做高可用一台主SM出现问题备SM可以在秒级接管。如果没有SM整个IB网络会是Down状态所有端口都无法通信这一点和普通以太网截然不同很多新手第一次配置IB时的“全盘不通”几乎都是因为忘记启动SM。第五步是测试基本连通性。可以用ibping需要先给目标机器分配logical LID地址或使用GID方式然后再用RDMA带宽测试工具如ib_write_bw、ib_read_bw验证点对点带宽。在HDR环境下跑通单条200G链路后再逐步搭建整个fat-tree拓扑验证多路径和故障切换能力。5.2 子网管理器SM它的角色比你想象的更重要很多人在IB网络部署中踩的坑归根结底是没搞明白SM的定位。你可以把它理解成IB网络的操作系统所有端口、交换机、路由表都由它管理。IB交换机本身不像以太网交换机那样通过动态路由协议自己协商路径而是被动接受SM下发的转发表。交换机重启、链路抖动、增删节点都需要SM重新计算并下发更新所以SM所在服务器和它本身的高可用配置直接决定了整张IB网络的稳定性。实际生产里我们遇到过主SM进程异常但机器没宕机的情况备SM因为没有及时探测到超时而没有接管结果全网链路一直处于退化状态。排查时通过sminfo、smpquery等工具确认活跃SM的GUID和优先级之后我们给SM配置了更严格的健康探测周期并把SM进程用systemd托管做到崩溃自动重启。如果集群规模大还建议用NVIDIA UFM管理平台它集成了SM和监控功能能可视化呈现全网拓扑、端口速率、温度和事件告警比原生命令行直观很多。5.3 性能调优与网上排查的几个方向跑AI训练时发现通信性能不到预期先不要怀疑IB不行可以从三个方向排查。第一是确认GPUDirect RDMA有没有真正生效。很多情况下RDMA流量仍然走的是主机内存中转而不是GPU显存之间直接通信。用nvidia-smi topo -m查看GPU和HCA是否挂在同一颗CPU的PCIe switch下面在NCCL环境变量中把GPUDirect相关选项打开观察带宽测试结果来验证。第二是确认队列对和并发度配置。RDMA通信在建连时QP数量、Inflight请求数量、报文大小等参数会影响吞吐不是简单把数据发出去就行需要根据网络延迟带宽积做调优。第三是检查是否存在链路误码和硬件降速。用ibdiagnet做全网健康扫描它会检测误码率、信噪比和非降级链路很直观批量模式下可以帮助快速定位坏线缆和光模块。这里分享一个记忆深刻的排障经历某次训练集群整体带宽低于预期最初怀疑是交换机配置文件问题后来用ibdiagnet扫描后发现一批光模块的误码率高出正常值几个数量级。换掉光模块后性能立刻恢复正常。原因是这批模块是第三方兼容模块固件版本和交换机不完全匹配在高温下信号质量恶化严重。从那以后我们对所有非原厂线缆和光模块执行了严格的入网测试宁可在验收阶段多花时间做压力测试也不要上线后半夜打电话抢修。6. 关于IB的后续走向我的几点判断6.1 800G之后IB还有多大成长空间NDR接下来是XDR单端口800Gb/s预计会跟随AI集群需求逐步商用。NVIDIA推动IB升级的逻辑一直没有变GPU单卡算力快速增长通信带宽必须同步跟上否则训练效率会被网络卡死。从PCIe 5.0到PCIe 6.0从HDR到NDR再到XDR每次硬件升级都能支撑起更大规模的集合通信任务所以IB在超大规模AI集群里的用量大概率会继续增长。但值得留意的是机内互连技术比如NVLink和网络互连之间的边界会在未来更加明显。机内的NVLink可以做到每卡数千GB/s远超外部网络跨节点通信则继续由IB或无损以太网承担。这种分工决定了IB解决的重点可能从“追求绝对峰值带宽”转向“在超大集群规模下保持稳定、可预测的集体通信性能”带宽只是其中一个评价维度延迟、抖动、拥塞控制和可运维性会变得更加重要。6.2 什么样的人现在值得入手IB按我目前的经验如果你正在负责一个中等规模AI项目节点数量几十台以内预算又有限那可以先从RoCEv2或HDR级别的IB入手HDR的性价比很合适。如果项目方向是长期做基础大模型预训练、集群规模会持续扩展到几百上千卡那么一步到位上NDR会更安心避免一年后因为带宽不够再推倒重来。对HPC领域的团队来说IB在并行计算场景下的生态和工具链积累依然是最好的只要有相关预算和运维支持继续选用IB不会错。我个人在实操中的一个体会是InfiniBand这套网络的“坑”远比看起来要多但绝大多数坑都不是技术原理上的深奥问题而是布线、固件、配置和监控这些基础设施问题。只要你按照厂商参考架构做设计严格验收每一条链路配好高可用SM再借助UFM和ibdiagnet这类工具进行日常巡检IB会是一个非常省心的高性能网络。写到这里我建议第一次尝试IB的朋友先找两台服务器加一台小交换机搭一个最小的两节点拓扑亲手把这些命令和流程走一遍比看再多资料都更有用。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门