滚动新闻 →
纯电动车为什么不需要传统变速箱 伊朗最高领袖持续隐身 川普透露最新判断 要么买断要么当教练 刘翔微博发文征询网友如何选 CPU 为什么没有被 AI GPU 完全取代,AI 服务器中的 CPU 到底承担哪些工作 一路冲毁大坝和村镇 中尼边境恐怖泥石流(视频集) 乌军扩大打击俄经济 马斯克获乌国家勋章 AI 推理为什么会出现 GPU 空闲但请求仍然变慢,系统瓶颈可能藏在哪里 时隔7年不忍了 王一博起诉《陈情令》5出品方 企业购买 SaaS 前应该考虑什么,别只看软件功能和宣传页面 台湾经济好旺!大摩上调GDP冲40年最高!  甲醛白菜恐致癌:3招自保方式一次看懂 中共对上市公司“割韭菜” 逾百企业被迫补税77亿 电脑开机有风扇转动却没有画面,显示器和主机应该怎样分别检查 西藏边境突发洪水 已近400名游客失踪 场面恐怖 中共出入境管制 设35类出境红线 锁定52类特定人群 Windows 11 复制和粘贴有哪些技巧?掌握剪贴板可以节省大量时间 “竹知了”风波未平 华为与“公厕”照片爆火 巧!大西洋热带风暴“多莉”将至 与一代歌后重名 3岁看新闻联播 “五道杠少年”现况引关注 开发 PHP 网站前,应该掌握哪些服务器目录和文件结构知识 俄远东天然气厂火灾致7死 其中6人为中国公民 周瑜为什么总是被后世重新评价 西藏吉隆口岸泥石流 致重大人员伤亡、失联 4牦牛闯入四川黄龙五彩池 景区回应 60岁李若彤现身上海 皮肤白皙紧致惊艳全场 内蒙古一车辆过桥被山洪冲走 5人全部遇难 中国惊爆甲醛大白菜 美日农民收菜影片热传 夏季养生与传统中医的关系 美国中情局长神秘访俄 基辅同意暂停袭击莫斯科 古琴不同流派的演奏风格有什么区别 孩子做事情只考虑自己怎么办 从胶片到数码影像摄影技术走过的时代变迁 庇护申请不是“护身符”38岁中国女在加州被捕 山东一家送子求学变“逆子求学”影片笑翻全网 从蒸汽时代到信息时代:近代世界如何一步步走来 重庆村民套野猪出事 300斤野猪疯狂反击致1死1伤 好的家居设计 最终还是为了让生活更方便 一代传奇殒落!11座格莱美歌后Dolly Parton去世 从街边小吃看一座城市 美军机突降莫斯科 惊传中情局长秘访俄罗斯

CPU 为什么没有被 AI GPU 完全取代,AI 服务器中的 CPU 到底承担哪些工作

发布时间: 2026-08-26 09:00:02    最后更新: 2026-08-26 10:05:24    阅读:4  约12 分钟阅读     

【中国观察北京时间2026年08月16日】

随着大模型训练和推理越来越依赖 GPU,很多人会产生一个疑问:既然 GPU 的并行计算能力远远超过传统 CPU,为什么 AI 服务器仍然需要配置强大的 CPU?既然 GPU 已经成为 AI 计算的核心,CPU 是否最终会被 GPU 取代?

答案是否定的。

GPU 取代的并不是 CPU,而是 CPU 在特定类型计算任务上的一部分工作。AI 服务器真正的发展方向并不是 CPU 与 GPU 二选一,而是让 CPU、GPU、内存、存储和网络设备分别承担自己最擅长的工作,并通过高速互联形成一个完整的计算系统。

理解这一点,需要先区分 CPU 和 GPU 的设计目标。

CPU 和 GPU 从设计开始就是两种不同的处理器

CPU 的核心数量通常远少于 GPU,但每个 CPU 核心拥有更强的通用处理能力。CPU擅长处理复杂程序逻辑、条件判断、系统调用、线程调度以及各种不可预测的任务。

例如服务器需要启动操作系统、运行数据库、处理网络请求、管理文件系统、执行安全检查,或者根据不同条件决定下一步执行什么代码,这些任务都高度依赖 CPU。

GPU 的设计思路完全不同。

GPU拥有大量计算核心,更适合同时执行数量庞大的、结构相似的计算任务。神经网络中的矩阵乘法、向量运算以及大量张量操作正好符合这种特点。

因此,GPU真正强大的地方不是简单地比 CPU 更快,而是能够以极高的并行度处理特定类型的计算。

可以把两者简单理解为:

CPU负责处理复杂而多变的任务,GPU负责处理规模巨大且高度并行的计算。

这也是为什么 AI 服务器需要两种处理器。

AI 训练并不是把所有工作都交给 GPU

一个 AI 模型开始训练之前,首先需要读取数据。

训练数据可能存储在本地 NVMe SSD、网络存储或者对象存储系统中。数据被读取以后,还需要经过文件系统、驱动程序、数据解码、预处理、批次组织等多个环节,最终才能形成 GPU 可以处理的数据。

这些工作并不适合全部交给 GPU。

例如,一套训练程序可能需要扫描大量文件,读取不同格式的数据,对图片进行解码,对文本进行处理,然后按照 batch 组成训练数据。

CPU会参与这些任务中的大量系统侧和通用计算工作。

当数据准备完成后,程序才会把数据传送到 GPU。

因此,一次典型的训练过程并不是:

CPU 把数据交给 GPU,然后 CPU 就什么都不做。

实际过程更接近:

存储系统 → CPU和系统内存 → 数据预处理 → 数据传输 → GPU计算 → 结果处理 → 下一批数据

在这个过程中,CPU不断协调系统中的不同组件。

如果 CPU、存储或者数据处理环节速度太慢,就可能出现 GPU 等待数据的情况。

这时候即使服务器安装了性能非常强大的 GPU,也无法充分发挥 GPU 的计算能力。

CPU负责管理系统内存,但并不意味着CPU亲自搬运所有数据

这里有一个容易产生误解的地方。

在 AI 服务器中,CPU负责操作系统层面的内存管理、进程管理和 I/O 协调,但数据从系统内存传输到 GPU 显存时,并不是由 CPU 核心亲自逐字节复制。

现代服务器大量使用 DMA 等机制,让设备能够直接访问内存并进行数据传输。

例如 GPU 通过 PCIe 与 CPU 和系统内存连接时,数据传输可以由相关硬件机制完成,CPU主要负责配置、管理和协调。

这也是现代服务器能够同时处理大量 I/O 和计算任务的重要原因。

因此,更准确的说法不是 CPU 负责搬运所有数据,而是:

CPU负责组织和管理数据流,而专用硬件负责完成大量实际的数据传输。

CPU还承担着服务器本身的运行任务

GPU主要负责计算,但一台 AI 服务器首先仍然是一台服务器。

它需要运行 Linux 等操作系统,需要管理用户进程、文件系统、网络接口、存储设备、权限和各种后台服务。

这些工作主要由 CPU 完成。

例如用户提交一个模型训练任务以后,服务器需要:

接收任务请求;

启动相关进程;

加载训练程序;

分配系统资源;

读取配置文件;

访问存储;

建立网络连接;

加载模型;

初始化 GPU;

启动训练任务;

监控运行状态;

处理异常;

保存训练结果。

GPU主要负责其中计算量最大的部分,但并不负责整个服务器的软件运行环境。

因此,即使 GPU 的计算能力再强,也不能简单把 CPU 拿掉以后让 GPU 单独承担传统服务器的全部职责。

多 GPU 服务器更加需要 CPU 进行协调

一台 AI 服务器可能安装多块 GPU。

例如一台服务器安装 4 张、8 张甚至更多 GPU 时,系统需要管理这些 GPU 与 CPU、内存、存储和网络设备之间的关系。

CPU需要负责设备初始化、驱动管理、任务启动以及大量系统级协调工作。

与此同时,GPU之间还可能通过 NVLink、NVSwitch 等高速互联技术进行通信。

这里尤其需要注意,CPU并不是多 GPU 通信中的所有数据都必须经过的中转站。

现代 AI 服务器的设计目标恰恰是尽可能减少不必要的数据绕行。

例如在支持相应硬件和软件的系统中,GPU可以通过高速 GPU 互联直接交换数据,从而避免所有数据都经过 CPU 内存。

因此,现代 AI 服务器实际上是在不断建立更复杂的高速数据通道:

CPU ↔ PCIe ↔ GPU

以及:

GPU ↔ GPU 高速互联

同时还存在:

GPU ↔ 网络适配器 ↔ 高速网络

这些路径共同决定了 AI 服务器的数据吞吐能力。

分布式训练中,CPU依然不可缺少,但角色发生了变化

当 AI 模型规模扩大到单台服务器无法容纳时,就需要使用多台服务器组成集群。

这时候,GPU负责大量模型计算,而服务器之间则需要通过高速网络交换数据。

在分布式训练中,AllReduce 等集合通信操作需要大量 GPU 之间交换梯度和其他数据。

现代 AI 集群通常会尽可能利用 GPU 直接通信、RDMA、高速网络适配器以及专门的通信库降低 CPU 参与数据路径的程度。

因此,不能简单理解为 CPU负责 AllReduce。

更加准确的理解是:

CPU负责训练进程、通信初始化、系统资源和任务生命周期等控制工作,而 GPU、GPU互联和高速网络设备承担大量实际的数据通信工作。

这也是现代 AI 集群越来越强调 GPU Direct、RDMA、NVLink 和 NVSwitch 等技术的原因。

目标就是让数据尽可能走最短、最高效的路径。

推理服务器中,CPU的作用同样重要

AI 推理并不只是把一个模型扔进 GPU 然后等待结果。

以一个大型语言模型服务为例,用户首先通过网络发送请求。

服务器需要接收连接、解析请求、进行身份验证、管理请求队列、执行调度,然后决定什么时候让 GPU 执行推理。

当多个用户同时发送请求时,还需要进行并发管理和资源调度。

这些工作大量依赖 CPU。

GPU则主要负责模型推理过程中计算量巨大的矩阵和张量运算。

因此,一个高性能 AI 推理系统通常需要同时解决两个问题:

如何让 GPU 算得快,以及如何让足够多的请求持续、高效地进入 GPU。

如果 CPU 处理请求的能力不足,GPU可能出现空闲。

反过来,如果 GPU计算能力不足,即使 CPU能够处理大量请求,也无法提高最终推理吞吐量。

这就是典型的系统级瓶颈。

CPU性能太弱,也可能限制 GPU

很多人认为既然 GPU负责 AI 计算,那么 CPU只要能够启动系统就够了。

这同样不正确。

如果 CPU 性能不足,可能导致数据预处理跟不上 GPU 的计算速度。

例如训练图片模型时,大量图片需要读取、解码、裁剪和增强。如果 CPU处理速度不足,GPU完成上一批数据以后就可能需要等待下一批数据。

这时候 GPU 利用率会下降。

同样,在推理服务器中,如果 CPU无法及时处理网络请求、请求调度和数据准备,也可能导致 GPU无法持续保持高利用率。

所以 AI 服务器真正需要优化的是整个数据路径,而不是单独追求某一个芯片的性能。

为什么不能让 GPU 直接承担 CPU 的工作

GPU并不是不能执行普通程序,而是它的硬件设计并不适合承担完整服务器环境中的所有通用任务。

GPU非常擅长:

大量线程;

高度并行;

规则的数据处理;

矩阵和向量计算。

但面对复杂的分支逻辑、操作系统任务、系统调用、随机访问以及大量不同类型的小任务时,CPU通常更加灵活。

例如一个服务器程序可能需要不断面对不同情况:

如果用户认证失败,就返回错误;

如果文件不存在,就读取备用位置;

如果网络连接中断,就重新建立连接;

如果 GPU 忙碌,就把任务放入队列;

如果任务超时,就取消任务。

这种控制逻辑并不是 GPU 最擅长的工作。

因此,GPU越强,并不意味着 CPU越没有价值。

恰恰相反,随着 GPU 计算能力不断提高,CPU需要承担的数据准备、任务协调和系统管理工作也可能变得更加重要。

AI服务器真正的瓶颈已经从单一芯片转向整个系统

现代 AI 服务器的性能已经不能简单用 CPU 或 GPU 的单项参数判断。

一台服务器可能拥有非常强大的 GPU,但如果 PCIe 拓扑设计不合理、CPU 内存带宽不足、NVMe 存储速度不足或者网络带宽不足,最终性能仍然可能受到限制。

因此,AI 服务器实际上是一个完整的计算和数据传输系统。

可以把它看成几个层次:

CPU负责通用计算和系统控制。

系统内存负责为 CPU 和其他设备提供高速数据空间。

GPU负责大规模并行计算。

NVMe等存储设备负责提供数据。

PCIe负责连接 CPU、GPU、SSD 和其他高速设备。

NVLink、NVSwitch等技术负责在特定 GPU 系统中提供更高带宽的 GPU 间通信。

高速网络负责连接不同服务器。

这些组件共同决定 AI 工作负载最终能够达到多少吞吐量。

CPU没有被GPU取代,而是变成了AI计算系统中的控制与协调核心

AI 计算的发展并没有让 CPU 失去价值,而是改变了 CPU 在计算系统中的位置。

过去,CPU可能同时承担大量通用计算任务。

现在,在 AI 服务器中,大规模矩阵和张量计算越来越多地交给 GPU、TPU 等专用加速器完成。

CPU则更加集中于自己擅长的工作:

运行操作系统;

管理进程和线程;

处理网络和存储;

管理系统内存;

进行数据预处理;

启动和协调 GPU 工作;

管理容器和虚拟机;

处理用户请求;

维护整个服务器的软件环境;

协调 GPU、存储和网络设备之间的关系。

因此,AI 服务器并不是用 GPU 替代 CPU,而是在形成一种更加明确的异构计算架构。

未来 AI 服务器的发展重点,也不会只是单纯比较 CPU 和 GPU 谁更强,而是看 CPU、GPU、内存、PCIe、GPU 高速互联、存储和网络能否形成高效的数据通路。

真正高性能的 AI 服务器,最终追求的不是让某一个芯片承担所有工作,而是让每一种计算资源都做自己最擅长的事情,并让数据以尽可能低的延迟和尽可能高的带宽在这些计算资源之间流动。

这也是为什么在 GPU 已经成为 AI 计算核心的今天,CPU 依然是 AI 服务器不可缺少的基础组件。

喜欢这篇报道?

使用下面的功能,方便以后继续阅读和分享 MNewsTV

设为 Google 新闻首选来源 让 Google 新闻优先显示 MNewsTV 的最新报道
我的收藏 查看已经收藏的文章
关于文章收藏 收藏不需要注册帐号,收藏信息仅保存在当前浏览器中。 删除收藏请进入「我的收藏」进行管理。
分享这篇报道

分享 Facebook | X | WhatsApp | LinkedIn

捐助(Paypal): https://www.paypal.me/observeccp
订阅中国观察电报 Telegram : https://t.me/s/ObserveCCP