【中国观察北京时间2026年08月16日】
在一台 AI 服务器里,GPU 看起来是最重要的计算设备,但真正决定多张 GPU 能不能高效协同工作的,不只是 GPU 本身,还有 GPU 之间的数据通道。
这也是为什么在 AI 服务器的硬件规格中,经常会同时看到 PCIe 和 NVLink。
两者都可以传输数据,但它们解决的并不是完全相同的问题。
简单来说,PCIe 是服务器中通用的高速 I/O 互联标准,而 NVLink 是 NVIDIA 针对 GPU 之间高带宽通信设计的专用互联技术。
理解这个区别,也就能理解为什么一台服务器可以装很多 GPU,却不一定能够让这些 GPU 像一个整体一样高效工作。
PCIe 首先解决的是 GPU 如何接入服务器
PCIe 的全称是 Peripheral Component Interconnect Express。
它是一种通用高速互联标准,并不是专门为 GPU 设计的。
服务器中的 GPU、NVMe SSD、网络适配器等设备,都可以通过 PCIe 接入系统。
因此,一张 PCIe GPU 插入服务器之后,实际上是在加入整个服务器的 I/O 架构。
典型的数据路径可能是:
CPU
│
PCIe Root Complex
│
PCIe Switch
├── GPU 0
├── GPU 1
├── NVMe SSD
└── Network Adapter
具体服务器是否使用 PCIe Switch,以及不同设备之间经过什么路径,要看主板、CPU、PCIe Switch 和 GPU 的实际拓扑。
这也是理解 PCIe 的关键:
PCIe 是一种通用的设备互联基础设施。
它的价值不仅在于速度,还在于标准化、兼容性和广泛的设备支持。
PCI-SIG 将 PCIe 定义为通用的 I/O 架构,并且通过不断提高每条 Lane 的传输速率来增加带宽。PCIe 5.0 的信号速率达到 32 GT/s;一个 x16 链路的原始有效带宽约为每个方向 64 GB/s,也就是双向同时传输时约 128 GB/s。
因此,把 PCIe 5.0 简单说成“32 GB/s”是不严谨的,因为这里很容易把单向带宽、双向聚合带宽以及不同 Lane 数量混在一起。
NVLink 解决的是另一个问题
当服务器只有一张 GPU 时,CPU、GPU、内存和存储之间的数据交换通常是主要问题。
但当服务器拥有 4 张、8 张甚至更多 GPU 时,情况发生了变化。
GPU 不再只是分别接受 CPU 的任务。
在很多 AI 训练任务中,GPU 之间本身就需要大量交换数据。
例如数据并行训练时,不同 GPU 分别处理不同的数据批次,但在计算过程中需要进行梯度同步。
模型并行或者张量并行时,不同 GPU 甚至可能共同负责一个模型的不同部分,需要更加频繁地交换中间结果。
这时候,GPU 与 GPU 之间的通信就不再是一个附属问题,而可能成为整个系统性能的重要组成部分。
NVLink就是针对这类 GPU-GPU 高速通信场景设计的。
NVIDIA 将 NVLink 定义为高速 GPU 互联技术,并且随着不同代际持续提高 GPU 间的互联带宽。当前 NVIDIA 公布的 Hopper、Blackwell 和 Rubin 平台,NVLink 每 GPU 的总带宽规格分别达到 900 GB/s、1,800 GB/s 和 3,600 GB/s。
这里必须注意,这些数字不能直接拿来和 PCIe 的某一个数字进行简单比较。
因为两者的链路组织方式、GPU 型号、链路数量以及统计口径都不同。
真正重要的是:
NVLink的设计目标就是让GPU之间能够建立远高于普通PCIe GPU互联场景的数据交换能力。
为什么 GPU 之间需要这么高的带宽
原因来自 AI 计算本身。
GPU 最擅长的是大规模并行计算。
假设一台服务器有 8 张 GPU。
理想状态下,8 张 GPU 应该尽可能长时间进行计算。
但如果 GPU 计算完成一部分工作之后,需要等待其他 GPU 的数据,那么情况就会变成:
GPU 0:计算 → 等待数据
GPU 1:计算 → 等待数据
GPU 2:计算 → 等待数据
GPU 3:计算 → 等待数据
...
GPU 的计算能力再强,如果通信跟不上,计算资源就无法充分发挥。
这就是 AI 服务器中的一个重要问题:
计算速度越来越快以后,数据交换速度也必须跟上。
这也是 GPU 互联技术越来越重要的原因。
多 GPU 并不是简单地把几张显卡插在一起
这是很多人第一次接触 AI 服务器时容易产生的误解。
一台机器安装 8 张 GPU,并不意味着它天然就拥有一个完整的 8 GPU 高性能计算系统。
真正需要关注的是:
GPU数量
↓
GPU之间如何连接
↓
每张GPU能够获得多少通信带宽
↓
不同GPU之间的通信路径是否一致
↓
通信是否会经过共享的PCIe链路
↓
软件能否充分利用这种拓扑
例如两张 GPU 可能通过 PCIe Switch 连接。
另外两张 GPU 可能连接到另一个 PCIe Switch。
两个 Switch 再通过更上层的 PCIe 结构连接。
这样一来,GPU 之间虽然都能够通信,但不同 GPU 对之间的通信路径和可用带宽可能并不完全相同。
所以在高性能 AI 服务器中,工程师不仅看 GPU 数量,还会非常关注 GPU 拓扑。
NVLink 并不是简单地把 PCIe 替换掉
这是理解两者关系非常重要的一点。
实际 AI 服务器通常不是:
PCIe 或 NVLink
二选一。
而更常见的是:
CPU
│
PCIe
│
GPU
║
NVLink
║
GPU
PCIe 和 NVLink 在系统中承担不同角色。
PCIe负责把GPU接入整个服务器,包括 CPU、内存、NVMe、网络设备等。
NVLink则重点解决GPU之间的高速通信问题。
因此,两者不是简单的竞争关系,而是可以形成分层的互联架构。
为什么不能只不断提高 PCIe 的速度
既然 PCIe 5.0、6.0 甚至更高版本都在不断提高带宽,那么为什么还需要 NVLink?
因为服务器互联并不只是一个“数字越大越好”的问题。
PCIe 的目标是建立一种通用、高兼容性的设备互联体系。
它需要支持各种类型的设备,而不是只针对 GPU-GPU 通信进行优化。
AI 训练则有完全不同的需求。
GPU 之间可能需要持续进行大规模数据交换,而且通信模式具有高度并行的特点。
如果所有 GPU 都通过通用 I/O 体系进行通信,那么实际性能还会受到服务器具体拓扑、共享链路、PCIe Switch、CPU 与 GPU 的连接方式等因素影响。
因此,当 GPU 计算能力不断提高时,单纯依靠通用 I/O 链路继续扩展,并不一定能够得到理想的 GPU-GPU 通信效率。
专门的 GPU 互联可以针对这种通信模式进行设计。
NVLink 的价值不只是带宽
如果只把 NVLink 理解成“比 PCIe 更快”,其实还是过于简单。
真正重要的是它改变了 GPU 之间的通信方式和系统拓扑。
在支持 NVLink 的 NVIDIA 平台中,多张 GPU 可以通过 NVLink 建立高速互联;在更大规模的系统中,还可以通过 NVLink Switch 扩展 GPU 之间的通信范围。
这意味着 GPU 不再只是通过服务器的通用 I/O 路径进行数据交换,而是拥有专门设计的 GPU 通信网络。
NVIDIA 当前的数据中心 NVLink 产品已经包含 NVLink Switch,用于构建更大规模的 GPU 互联域。
因此,判断一个多 GPU 系统的通信能力时,不能只看 GPU 型号,还需要看:
GPU之间采用什么互联方式
NVLink属于哪一代
每张GPU有多少条互联链路
是否使用NVLink Switch
PCIe属于哪一代
GPU如何连接CPU和PCIe Switch
不同GPU之间的通信路径是否一致
软件和通信库能否充分利用这些硬件连接
这些因素共同决定了实际的 GPU-GPU 通信能力。
PCIe 也并没有失去价值
不能因为 NVLink 更适合 GPU-GPU 高速通信,就认为 PCIe 已经不重要。
恰恰相反,PCIe 仍然是现代服务器的重要基础设施。
GPU 需要通过 PCIe 接入服务器平台,NVMe SSD、网络适配器等设备同样需要 PCIe。
而且并不是所有 AI 工作负载都需要 NVLink。
如果某个应用中的 GPU 通信量较低,那么 PCIe 完全可能已经足够。
例如一些推理任务可以把不同请求分配给不同 GPU,使 GPU 之间几乎不需要频繁交换大量中间数据。
这种情况下,NVLink 的价值就可能没有训练大型模型那么明显。
所以不能简单地说:
有 NVLink 的服务器一定比只有 PCIe 的服务器快。
真正的问题应该是:
这个工作负载需要多少 GPU-GPU 通信,以及服务器的互联结构能不能满足这种通信需求。
真正影响多 GPU 性能的是通信与计算的平衡
AI 服务器的性能最终不是由某一个硬件参数决定的。
可以把整个过程理解成:
数据进入服务器
↓
CPU / 内存 / 存储
↓
PCIe
↓
GPU计算
↓
GPU之间交换数据
↓
继续计算
如果 GPU 计算速度非常快,而 GPU 之间的数据交换速度跟不上,那么 GPU 就可能出现等待。
反过来,如果通信能力非常强,但 GPU 本身计算资源不足,也不会得到理想的性能。
因此,多 GPU 系统真正追求的是:
让计算和通信尽可能重叠,让 GPU 少等待,让更多计算时间真正用于模型计算。
这也是为什么在 AI 集群设计中,GPU、GPU 互联、PCIe 拓扑、CPU、内存、网络和存储需要作为一个完整系统来考虑。
不同规模的 AI 系统,对互联的要求也不同
一台普通工作站可能只有一两张 GPU。
这种情况下,PCIe 通常已经可以满足基本需求。
当服务器增加到 4 张、8 张 GPU,训练任务开始大量使用数据并行、张量并行或者模型并行时,GPU-GPU 通信的重要性明显增加。
到了更大规模的 AI 集群,问题又进一步扩大。
服务器内部需要解决 GPU-GPU 通信,服务器之间还需要通过高速网络完成节点间通信。
因此,一个大型 AI 系统实际上存在多个通信层级:
GPU
↕
GPU高速互联
↕
服务器内部通信
↕
高速网络
↕
其他服务器
这时候,NVLink、PCIe、InfiniBand、RoCE 等技术解决的是不同层次的问题,不能简单地把它们看成同一种技术的不同版本。
最容易被忽视的是服务器拓扑
对于真正做 AI 服务器部署的人来说,单独看产品宣传页面上的“带宽”往往是不够的。
例如,同样是 8 张 GPU:
方案A
8张GPU
每张GPU之间都有高速互联
方案B
8张GPU
分成两个PCIe拓扑
部分GPU之间通信需要经过更长路径
方案C
8张GPU
GPU之间有专用互联
同时还通过高速网络连接其他服务器
它们虽然 GPU 数量相同,理论计算能力也可能相近,但实际训练效率可能存在明显差异。
原因就在于:
GPU 的计算能力是一个维度,GPU 之间如何交换数据是另一个维度。
这也是为什么专业的 AI 服务器设计不会只问“装了多少张 GPU”,还会查看 GPU topology、PCIe topology、NVLink connectivity,以及 CPU、内存和网络之间的连接关系。
PCIe 与 NVLink应该怎样理解
如果把整个服务器看成一个交通系统,那么 PCIe 更像是一套通用道路系统。
它连接 GPU、SSD、网卡以及其他设备,让各种硬件能够加入服务器。
NVLink则更像是专门为 GPU 之间建设的高速通道。
当 GPU 之间需要频繁交换大量数据时,这条专用通道能够减少通用 I/O 路径带来的限制。
所以,两者真正的区别并不是简单的:
NVLink快
PCIe慢
而是:
PCIe
→ 通用设备互联
→ 负责GPU接入服务器
→ 强调标准化、兼容性和广泛应用
NVLink
→ GPU专用高速互联
→ 重点解决GPU-GPU通信
→ 面向高带宽、多GPU计算场景
对于 AI 服务器,真正需要关注的也不是 NVLink 能否完全替代 PCIe,而是不同层级的互联是否与工作负载匹配。
当模型训练需要多张 GPU 高频交换数据时,GPU 之间的通信就会成为性能的重要组成部分。此时,高带宽 GPU 互联能够帮助减少通信等待,让 GPU 的计算能力得到更充分的利用。
而 PCIe 依然承担着服务器内部大量设备互联的基础工作。
因此,一台高性能多 GPU AI 服务器真正的设计重点,从来不是单独追求某一个最高带宽数字,而是把 GPU、PCIe、NVLink、CPU、内存、存储和网络组织成一套合理的拓扑,让数据尽可能按照最短、最高效的路径流动。
这才是理解 NVLink 与 PCIe 区别,以及理解多 GPU 服务器为什么需要高速互联的关键。
NVLink 与 PCIe 有哪些本质区别,多 GPU 通信为什么需要专门的高速互联
喜欢这篇报道?
使用下面的功能,方便以后继续阅读和分享 MNewsTV
关于文章收藏
收藏不需要注册帐号,收藏信息仅保存在当前浏览器中。
删除收藏请进入「我的收藏」进行管理。
分享 Facebook | X | WhatsApp | LinkedIn
捐助(Paypal): https://www.paypal.me/observeccp 订阅中国观察电报 Telegram : https://t.me/s/ObserveCCP