PCIe一直是大多数数据流量从处理器传输到其他设备的首选网络,这也是新型数据中心AI扩展网络的功能。这些新型网络的出现似乎表明PCIe已无法胜任这项任务,但事实证明,在AI领域,PCIe非但没有被边缘化,反而因对智能体和其他新型AI形式的关注而得到加强,而非削弱。
CXL 与 PCIe 密切相关,位于 PCIe 协议栈的最顶层。由于开发者仍在评估其实用性,CXL 的发展初期较为缓慢,甚至有人质疑它能否真正普及。但随着交换机进入市场,以及系统开发者逐渐明确 CXL 的应用场景,它开始展现出越来越旺盛的势头。
PCIe拥有悠久的历史
它于 2003 年首次发布,作为一种串行互连方案,彻底取代了旧式的 PCI 并行连接计算机外设的方式。其初始性能为每通道 2.5 Gb/s,最大 x16 配置可提供 4 GB/s 的吞吐量。
该规范已发展到 2025 年发布的 7.0 版本。它每通道的传输速率为 128 Gb/s(包括纠错位),净吞吐量为 242 GB/s。
Cadence公司设计IP产品营销副总裁Arif Khan表示:“PCIe速度正在翻倍。我们已经经历了一个拐点,过去几年里,增长曲线呈指数级上升。”
PCIe一直是几乎所有计算机相关设备的首选互连技术。虽然它最初主要面向个人电脑,但最新版本的性能已经远远超过个人电脑的需求,因此更多地被瞄准数据中心。
几年后的2019年,Compute Express Link(简称CXL)及其1.0规范问世。它实际上是在PCIe之上增加了一个内存和一致性扩展模块,第一个版本与PCIe 5.0同步发布。最新版本CXL 4.0于2025年发布,基于PCIe 7.0。
它由三个基本部分组成:
一个用于初始化、管理和设备发现等任务的基本非一致性标准(CXL.io)。
一种允许连接的 CXL 设备缓存主机内存并保持一致性的方法 (CXL.cache)。
一种使用加载/存储语义访问附加内存的方法,就像内存是服务器内部的内存一样(CXL.mem)。
CXL技术的普及速度一直较为缓慢,这让一些人质疑它能否真正流行起来。此外,人们在学习CXL技术方面可能也存在一些阻力。“人们对CXL的了解还不够深入,” Synopsys公司PCIe产品营销高级总监Antonio Costa表示,“随着我们看到更多应用案例,人们就会明白如何使用它。”
近期的迹象表明,CXL 技术正在复苏。
人工智能领域的新兴力量
与此同时,人工智能的蓬勃发展使得数据中心成为执行训练和推理工作负载的重要关注点。GPU(图形处理器)备受瞩目,各方都在致力于提升基于GPU的系统的性能,包括其互连性能。
其结果是网络出现了某种程度的分化,产生了截然不同的扩展方式:
Scale-up:它以某种方式聚合 GPU,使它们看起来像一个具有统一内存空间的单个巨型 GPU,并使用内存语义。
Scale-out:使用 RDMA 语义访问更多远程资源。
Scale-across:一种类似于横向扩展的变体,但它覆盖的距离更长。
UALink 是一种有助于实现Scale-up的新标准。英伟达的专有 NVLink 提供多种互连方式,包括Scale-up。
Scale-out是指将网络覆盖范围扩展到更远的地方,而以太网在这方面占据主导地位。但以太网存在一些弱点,尤其会影响尾延迟,因此人们正在对其进行各种改进以提高性能。
这些发展使得人工智能扩展网络始终备受关注,而PCIe等传统互连方式则逐渐被边缘化。过去,扩展规模的概念必然会涉及到PCIe,因为它是本地互连处理器的基本方式。但如今,PCIe的作用正在减弱,至少在某种程度上是如此。那么,未来还剩下什么呢?
关键在于你连接的是什么
如果你试图追踪所有与人工智能相关的发展,你可能会得出GPU才是最重要的结论,这会导致你误以为Scale-up网络正在占据主导地位。但事实并非如此。
GPU承担了人工智能的大部分繁重数学运算。Scale-up网络专门用于互连GPU,无需CPU作为中间环节。这与其他通常需要经过CPU的互连方式截然不同。
Khan说:“你的CPU与加速卡通信时,使用的是哪种芯片协议?在很多情况下,加速卡都安装在PCIe插槽中。”
这就是 PCIe 的作用所在。CPU 何时与 GPU 通信?这不会通过 UALink 之类的协议,而是通过 PCIe,以及 CPU 所涉及的所有其他通信。
这直接影响到Scale-out,Scale-out正是利用了以太网的各种变体。“PCIe 特别适合实现Scale-out架构,” Rambus硅 IP 产品营销高级总监 Lou Ternullo 指出。
PCIe 将 CPU 连接到网络接口卡 (NIC),因此,尽管Scale-out的讨论通常会忽略这一点,但 PCIe 实际上也参与其中。“智能网卡拥有大量的输入和输出带宽,因此,PCIe 的高速特性仍然被广泛应用,”Khan 指出。
其他人也同意这种观点。“Scale-out实际上拓宽了 PCIe 的市场,因为你用到了网卡,而网卡依赖于 PCIe,”Cadence 高速 SerDes 产品营销总监 Hui Wu 表示。
自从Scale-out被纳入考量以来,情况一直如此,但最新的人工智能发展正在改变这一格局。虽然传统的人工智能工作负载几乎完全依赖于GPU,CPU的作用仅限于调用和支持GPU,但智能体人工智能正在改变这一现状。
智能体人工智能需要CPU
来执行任务,这些任务如今可以帮助人类做出更好的决策或提高工作效率。但智能体主要在CPU上执行,并将各种推理工作负载卸载到GPU。它必须做出决策,而决策通常涉及分支操作,这种操作并不适合GPU。这意味着启动一个智能体会引发一个过程,在这个过程中,工作负载会在CPU和GPU之间来回切换,直到任务完成。
Synopsys公司的科斯塔表示:“人工智能加速器可以计算下一步操作,但最终执行操作的是CPU。人工智能的智能程度越高,执行这些操作所需的CPU就越多,因此需要扩展计算能力。”
随着智能体人工智能的兴起,对CPU的需求不断增长,而这些CPU需要互连。“过去GPU与CPU的比例是8:1,”Efinix公司负责市场营销的企业副总裁鲍勃·比奇勒(Bob Beachler)表示,“而现在,智能体人工智能的比例是1:1——一个CPU配一个GPU。”
对于此类连接而言,PCIe 是自然之选。这意味着 PCIe 在人工智能领域的作用也将日益凸显。
PCIe 确实具备scale-up的能力
UALink 的引入表明,需要某种技术来弥补 PCIe 能力上的不足。在某些情况下,的确如此。但并非所有系统都需要极致的吞吐量,而 PCIe 也能够胜任scale-up的任务。
“如今,几乎所有终端都支持 PCIe 互连,以便与 CPU 连接,”Ternullo 解释道。“撇开 NVLink 不谈,几乎 100% 的加速器都使用 PCIe 作为其主要互连方式。这种普及性是 PCIe 仍然是扩展场景(例如通过 PCIe 交换机连接多个加速器(GPU))最便捷选择的关键原因。虽然像 UALink 这样的新兴网络可能提供比 PCIe 更高的吞吐量,但 PCIe 架构及其生态系统的易用性和广泛应用使其成为 GPU/ASIC 加速器扩展应用的理想选择。我认为,PCIe 规范发展如此迅速,如今又推出了 PCIe 8.0.5,其主要原因就是为了进一步推动 PCIe 的扩展应用。”
UALink 在scale-up架构中肯定会占有一席之地,并且会在最适合它的场景下得到应用,但 PCIe 与所有终端的兼容性使其更容易在大多数环境中部署。同样重要的是要记住,性能最佳的解决方案并不总是会成为标准。成本和可及性是这些决策中的重要因素,通常比纯粹的技术性能更为重要。
边缘计算也存在其他协议
目前关于扩展性的讨论大多集中在数据中心,数据中心也因此获得了过多的关注。但人工智能也在边缘计算领域蓬勃发展,而边缘计算可能涉及其他协议,尤其是在涉及传感器的情况下。
摄像头就是一个很好的例子,而MIPI协议的核心在于将摄像头数据传递给任何需要它的人。“MIPI通常部署在网络边缘——摄像头、显示器、传感器、移动存储设备,”Silvaco旗下公司Mixel的市场营销总监Justin Endo表示, “它专为低功耗、低延迟和精简协议栈的流式传输而设计。”
这并非 PCIe 通常承担的任务。“PCIe 和 CXL 负责通用计算和存储芯片之间的繁重数据传输。PCIe 和 MIPI 在某些方面有所重叠,例如移动存储领域中 UFS over M-PHY 与 NVMe over PCIe 的对比,但它们位于同一协议栈的不同层级,而不是争夺同一个插槽,”Endo 解释道。
通常情况下,这些边缘数据最终都会传输到数据中心,但发送原始数据需要占用过多带宽。他举例说:“以 MIPI CSI 2 为例,它通过 MIPI PHY 将来自图像传感器的摄像头数据传输到手机、汽车、无人机和工业视觉系统等边缘 SoC 中。对于大多数推理部署而言,无法将原始图像批量传输到数据中心,因为数据量、功耗和延迟成本都非常高昂。CSI-2 将数据馈送到本地图像处理管道,使得时间关键型工作可以直接在传感器端完成,例如 ISP、感知、传感器融合或设备端推理。向上游(通过 PCIe)传输的通常是经过处理的结果,例如特征、嵌入和元数据,而不是原始像素。CSI 在 PCIe 接收到数据之前就对其进行了处理。这使得 PCIe 及其周边架构(例如 CXL、UALink 和 Ultra Ethernet)能够专注于它们擅长的领域——训练、内存池化以及机架级加速器之间的通信。”
虽然人工智能需要最高的带宽,但许多其他应用程序使用旧版本的 PCIe 也能正常工作,因此旧版 PCIe 仍然有很多使用寿命。
Khan表示:“对于很多固态硬盘和其他消费电子产品来说,客户对PCIe 2.0和3.0的数据传输速率感到满意,而且这种情况在未来很长一段时间内都会持续下去。”
其他系统可能需要更高的速度,但不一定需要最高速度。“目前市场上还没有 PCIe 6.0 CPU 系统,”Khan 补充道。“领先的 OEM 厂商尚未将这些产品投入生产。他们仍在进行内部测试或客户测试。但即使是 PCIe 5.0,在规范最终确定后,AMD 和 Intel 的系统也花了很长时间才进入市场。”
固态硬盘正在向速度更快的 PCIe 版本迁移,尽管并非总是最快的。“PCIe 6.0 固态硬盘现在相当普遍,我们有客户正在设计这类产品,”Khan 说。“我们也有客户开始设计 PCIe 7.0 产品,因为他们希望达到系统性能的峰值。”
CXL 正在复苏
由于 PCIe 依然强劲,它作为 CXL 底层 PHY 的地位依然稳固。然而,规范的更新时机可能阻碍了 CXL 的普及。“CXL 的发展受限于它依赖于 PCI 5.0 PHY,而这些系统上市时间漫长,”Khan 指出。“与此同时,CXL 规范也经历了巨大的变革。那么,采用者该怎么办呢?CXL 3.0 系统刚刚完成设计并准备上市,规范就升级到了 4.0。”
此外,CXL的不同应用场景并未获得同等认可。目前已正式确定了三种官方应用场景,实现这些场景的CXL设备分别被归类为Type 1、Type 2和Type 3:
Type 1支持使用相干存储器连接加速器。
Type 2可以访问主机内存。如果它们自身带有外接内存,主机就可以访问这些内存。
Type 3允许主机以一致的方式访问和管理远程内存。根据其构建方式,它可以被视为内存扩展或内存池。
由于延迟问题,使用 CXL 进行缓存遇到了一些阻力。“我们看到 CXL 的优势在于能够扩展缓存和主内存。在缓存方面,CXL 的表现略显不足,因为缓存必须具备极低的延迟,而我们并没有看到客户利用这一优势来扩展缓存,”Costa 表示。“但对于内存扩展而言,CXL 非常受欢迎,因为系统中的 HBM 或 DDR 内存容量有限。如果您需要进一步扩展,CXL 是一项非常好的技术,因为它延迟低,并且仍然可以将数据返回到缓存中。”
内存池化之争
与此同时,关于内存池化有效性的争论也愈演愈烈。由于业界仍在探索CXL的哪些部分最适合自身需求,这些因素减缓了CXL的整体普及速度。
尽管如此,CXL 生态系统正在不断扩展,这让开发者对 CXL 的发展前景更有信心。“更广泛的 PCIe 和 CXL 互连生态系统持续成熟,进一步提升了内存扩展的价值,”Ternullo 表示。“CXL 交换机在市场上越来越常见,PCIe 连接范围的扩展也进一步支持了可扩展内存池架构。”
智能体人工智能也可能促进CXL的发展。“我相信下一代CXL会更加重要,因为我们看到所有这些智能体人工智能都需要越来越多的计算能力,而我们相信CXL将在其中发挥作用,”Costa说道。
PCIe 和 CXL 技术持续发展
未来基于现有技术的升级版本也将进一步推动市场需求。预计 PCIe 8.0 将于 2029 年发布,其带宽将是 PCIe 7.0 的两倍。
科斯塔表示:“每条通道的传输速度将达到256 Gb/s,最多可支持16条通道。它将保持相同的信令,并在控制器端使用相同的数据片结构,因此不会有根本性的变化。”
CXL 正在开发 5.0 版本,但 CXL 联盟拒绝预测目标发布日期。
此外,目前正在努力通过新的线缆标准来延长 PCIe 连接线的长度。其中最引人注目的是两年前发布的 CopprLink,它支持在 PCIe 5.0 和 6.0 速度下连接长达两米的线缆。虽然 PCIe SIG 拒绝透露预计发布日期,但目前正在努力将 CopprLink 集成到 PCIe 7.0 中。
除了铜缆之外,人们仍在探索定义一种用于传输 PCIe 流量的光纤格式。同样,目前还没有预计的发布日期。
Ternullo 表示:“PCIe 重定时器和交换机的日益普及,以及 CopprLink 和 PCIe over optical 等新兴 PCIe 布线技术的出现,将扩展 PCIe 架构的覆盖范围,进一步实现横向扩展和纵向扩展部署。”
看不到尽头
这些迹象进一步表明,人工智能非但不会威胁到 PCIe,反而可能增强其竞争力。许多设备仍会继续使用旧版本,因为新版本的速度主要惠及数据中心。但对更高带宽的需求依然强劲。
虽然CXL活动进展缓慢,但正在加速。现在宣布彻底胜利还为时过早,但种种迹象表明形势正在好转。
所有这些都进一步印证了这样一个事实:新标准只是在现有基础上进行补充,而非取代。虽然选项众多,网络复杂性有所增加,但应用需求却很明确。例如,哪些类型的系统需要 UALink 之类的标准,这一点毋庸置疑。但无论数据中心是否需要扩展以支持人工智能,您很可能都会使用 PCIe。
*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。







