【中国观察北京时间2026年08月17日】随着大语言模型、生成式人工智能和高性能计算的发展,单个 GPU 的计算能力已经不再是决定系统性能的唯一因素。对于训练大规模模型,数十乃至数千个 GPU 往往需要同时工作,而这些 GPU 之间必须频繁交换激活值、梯度、参数以及其他中间数据。当 GPU 之间的数据通信速度跟不上计算速度时,昂贵的计算资源就可能因为等待通信而处于空闲状态。
NVSwitch 正是在这一背景下发挥作用的关键技术之一。它并不是一种独立于 GPU 的通用网络交换机,也不能简单理解为“把服务器连接起来的交换机”。更准确地说,NVSwitch 是 NVIDIA NVLink 高速互连体系中的交换芯片,用于在多个 GPU 或加速器之间建立高带宽、低延迟的通信路径,使多 GPU 系统能够形成高效的高速互连域。
理解 NVSwitch,需要首先区分 GPU 内存访问、GPU 间互连以及服务器间网络这三个不同层次。GPU 自身通过 HBM 等高带宽内存获得数据,GPU 与 GPU 之间则可以通过 NVLink 进行高速通信;当通信跨越不同服务器时,还需要依赖 InfiniBand 或高速以太网等网络技术。NVSwitch主要解决的是前一个层面的 GPU 间高速互连问题。
NVLink 与 NVSwitch究竟是什么关系
NVLink 是 NVIDIA 为 GPU 和其他加速器之间高速通信设计的互连技术。与传统 PCIe 相比,NVLink针对的是高性能加速器之间的大规模数据交换,在带宽、延迟以及拓扑组织方式等方面进行了专门优化。
但当系统中的 GPU 数量增加以后,仅依靠 GPU 之间点对点连接会迅速增加布线复杂度,同时也会受到 GPU 可提供的物理互连端口数量限制。NVSwitch 的作用,就是把大量 NVLink 链路组织成一个交换结构。
因此,可以把两者简单理解为:NVLink负责提供高速互连链路,NVSwitch负责对这些链路进行交换和组织。
在采用 NVSwitch 的多 GPU 系统中,GPU 不需要分别通过独立的物理线路与所有其他 GPU 建立一对一连接。数据可以通过 NVLink 进入 NVSwitch,再由交换结构转发至目标 GPU。这样,系统就能够在有限的物理连接条件下,为大量 GPU 提供较高的通信带宽和更灵活的互连路径。
这里有一个容易产生误解的地方:从软件和系统通信的角度看,多 GPU 系统可以表现出高度互联甚至近似全互联的通信能力,但这并不意味着每个 GPU 都通过独立物理链路直接连接其他每一个 GPU。物理拓扑、交换芯片数量、NVLink 链路数量以及具体 GPU 平台都会影响实际通信路径。
为什么大模型训练特别需要这种互连
现代大模型训练通常采用数据并行、张量并行、流水线并行等多种并行方式。随着模型规模扩大,GPU 之间需要交换的数据量也会迅速增加。
例如,在数据并行训练中,不同 GPU 会分别处理不同的数据,然后通过梯度同步让各个 GPU 保持模型参数的一致性。AllReduce 就是这类通信中的典型操作。
在模型并行环境下,情况更加明显。一个模型可能被拆分到多个 GPU 上,不同 GPU 分别负责不同的层、不同的张量或者不同的计算任务。一个 GPU 完成部分计算后,需要迅速把结果交给其他 GPU。如果 GPU 间通信速度不足,那么计算单元就必须等待数据到达。
因此,大模型训练的性能并不是简单地等于“GPU数量 × 单GPU性能”。
更准确地说,系统性能取决于计算能力、GPU 间通信能力、服务器间网络、内存和存储系统以及软件通信库之间的整体平衡。GPU 越强、数量越多,通信系统的重要性往往也越高。
NVSwitch解决的核心问题是什么
NVSwitch最重要的价值,是降低多 GPU 系统中 GPU 间通信受到拓扑限制的程度。
在没有高速交换结构的系统中,GPU 之间可能需要通过 PCIe 等通道进行通信。PCIe 本身是一种非常重要的通用高速互连标准,但它的设计目标并不是专门为大规模 GPU 间高强度通信而设计。
当多个 GPU 同时进行大规模数据交换时,通信链路、PCIe 交换结构以及主机 CPU 等都可能成为系统瓶颈。
NVLink 与 NVSwitch 则针对这一问题构建了专门的 GPU 高速通信体系。在支持 NVSwitch 的系统中,多个 GPU 可以通过 NVLink 接入交换结构,使 GPU 之间能够以更高的带宽进行数据交换,并减少部分传统 I/O 路径带来的限制。
需要特别指出的是,NVSwitch并不会增加 GPU 自身 HBM 的显存带宽。
HBM 带宽决定的是 GPU 与自身显存之间的数据传输能力,而 NVLink/NVSwitch解决的是 GPU 与 GPU 之间的数据通信问题。两者虽然都属于高带宽数据通路,但解决的是不同层面的瓶颈。
NVSwitch为什么对单机多GPU系统重要
在 AI 服务器中,8 GPU 已经成为一种常见的高性能配置,而更高密度的 GPU 系统则需要更加复杂的互连结构。
如果没有高性能 GPU 间互连,多 GPU 系统很容易出现一种典型现象:GPU 的计算能力已经足够强,但大量时间消耗在等待其他 GPU 的数据上。
采用 NVLink 和 NVSwitch 后,GPU 可以通过高速互连结构交换数据,从而减少通信成为主要瓶颈的可能性。
对于需要进行张量并行、模型并行以及其他细粒度并行计算的工作负载,这一点尤其重要。因为这类任务往往要求不同 GPU 在较短时间内频繁交换数据。如果通信延迟过高或者可用带宽不足,增加 GPU 数量并不会按照理论比例提高训练性能。
因此,在评价一台 AI 服务器时,只看 GPU 型号和数量是不够的。GPU之间采用什么互连方式、系统具有什么样的拓扑以及通信带宽如何,同样是判断整机性能的重要因素。
NCCL在其中扮演什么角色
NVSwitch解决的是硬件互连问题,而 GPU 之间真正进行大规模集合通信时,还需要软件层面的支持。
NVIDIA Collective Communications Library,也就是 NCCL,是 NVIDIA GPU 集群中非常重要的通信库。它提供 AllReduce、AllGather、Broadcast、ReduceScatter 等集合通信操作,并能够根据 GPU 拓扑和网络环境选择相应的通信路径。
因此,NVSwitch 和 NCCL 并不是同一种技术,也不是相互替代的关系。
可以简单理解为,NVSwitch提供硬件通信基础,NCCL则负责在软件层面组织和执行 GPU 集群中的通信操作。
当 NCCL 能够识别并充分利用底层 GPU 拓扑时,硬件互连的优势才更容易转化为实际训练性能。如果软件通信算法、GPU负载分配或者任务并行方式存在问题,再强的互连硬件也无法完全消除通信瓶颈。
NVSwitch并不等于跨服务器网络
这是理解 AI 集群架构时最容易混淆的地方之一。
NVSwitch主要用于服务器内部的高速 GPU 互连,而当数据需要从一台服务器上的 GPU 发送到另一台服务器上的 GPU 时,就进入了更高一层的网络通信体系。
大型 AI 集群通常会采用 InfiniBand 或高速以太网等技术连接不同服务器。这些网络承担服务器之间的通信任务,而服务器内部则可以通过 NVLink 和 NVSwitch建立 GPU 高速互连。
因此,一套大规模 AI 基础设施往往存在两个重要层次:
服务器内部:GPU → NVLink → NVSwitch → GPU。
服务器之间:GPU/网络适配器 → 高速网络 → 另一台服务器。
两者共同构成大规模 GPU 集群的通信基础。
这也意味着,单纯升级服务器内部的 NVSwitch 并不能解决所有集群通信问题。如果跨服务器网络的带宽不足、延迟过高或者网络拥塞严重,整个训练任务仍然可能受到影响。
GPU越多,并不意味着性能一定线性增长
理论上,增加 GPU 数量能够提高计算能力,但实际训练速度通常不会按照 GPU 数量完全线性增长。
原因在于,GPU 数量增加以后,计算任务需要进行更多的数据同步和通信。尤其是在模型并行和集合通信密集型工作负载中,通信开销可能逐渐占据更大的比例。
这也是为什么大型 AI 集群需要同时优化 GPU、NVLink、NVSwitch、网络交换机、通信库、存储系统以及任务调度。
一个设计良好的集群,需要让计算、通信、内存和存储之间尽可能保持平衡。如果 GPU 很强,而网络和通信系统无法提供足够的数据吞吐能力,那么新增 GPU 的边际收益就会下降。
从这个角度来看,NVSwitch的意义并不是简单地“让 GPU 更快”,而是帮助整个多 GPU 系统尽可能减少由于 GPU 间通信造成的计算等待。
NVSwitch的成本与局限
高速互连带来的性能优势并非没有代价。
首先,NVSwitch本身需要专用芯片、封装和高速互连设计,这会增加系统硬件复杂度和成本。随着 GPU 数量和互连规模扩大,系统的功耗、散热以及布线也会变得更加复杂。
其次,NVSwitch的性能优势高度依赖具体的平台设计。不同代际的 GPU、NVLink 和 NVSwitch具有不同的链路能力和拓扑结构,不能简单用一个固定带宽数字代表所有 NVSwitch 系统。
再次,通信性能还受到软件和工作负载的影响。如果模型本身的通信需求较低,那么高速 GPU 互连带来的收益可能有限;如果模型需要大量跨 GPU 同步数据,那么高速互连的重要性就会显著提高。
因此,评价 NVSwitch 时不能脱离具体硬件平台、GPU 数量、通信模式和软件栈进行简单比较。
从NVSwitch看AI基础设施的发展
AI计算正在从单 GPU 性能竞争逐渐转向整个系统的协同优化。随着模型规模不断扩大,计算芯片之间的数据交换已经成为决定系统效率的重要因素。
这也是 NVIDIA 持续发展 NVLink、NVSwitch 以及相关网络技术的重要原因之一。未来 AI 集群需要解决的不仅是单个 GPU 能够完成多少计算,还包括数百甚至数千个加速器如何有效地协同工作。
在这种体系中,高速互连技术的重要性可能继续提高。更高的链路带宽、更低的通信延迟、更合理的拓扑结构以及更高效的通信软件,都将直接影响大规模 AI 训练的实际效率。
NVSwitch的真正价值,也正是在这里体现出来。它不是一个单独决定 AI 集群性能的“神奇芯片”,而是 NVIDIA GPU 高速互连体系中的重要组成部分。通过 NVLink 与交换结构,它帮助多个 GPU 建立高性能的通信域;再通过 NCCL 等软件与服务器间高速网络协同工作,最终形成从单机多 GPU 到大规模 GPU 集群的完整通信体系。
对于今天的 AI 基础设施,GPU 决定了计算能力的上限,而 GPU 之间能否高效交换数据,则决定了这些计算能力在多大程度上能够真正被利用起来。NVSwitch所解决的,正是这一越来越重要的系统级问题。
NVSwitch 如何连接大规模 GPU,交换芯片在 AI 服务器和集群中的作用是什么
喜欢这篇报道?
使用下面的功能,方便以后继续阅读和分享 MNewsTV
关于文章收藏
收藏不需要注册帐号,收藏信息仅保存在当前浏览器中。
删除收藏请进入「我的收藏」进行管理。
分享 Facebook | X | WhatsApp | LinkedIn
捐助(Paypal): https://www.paypal.me/observeccp 订阅中国观察电报 Telegram : https://t.me/s/ObserveCCP