算力芯片是基础,但芯片本身不会凭空输出算力。真正把算力转化成ChatGPT这类生成式AI背后基座的,是一整套系统——而这张“网”的核心,就是PCIe总线。这一期,我们聚焦算力芯片如何通过PCIe完成算力输出,把整个计算链路串联起来。
先看算力服务器的物理形态。里面并不是一颗颗芯片简单堆叠,而是一张张算力卡并排插在卡槽里。目前主流配置通常是单台服务器放8张或16张算力卡。每张算力卡的核心是一枚计算芯片,旁边搭配大容量高带宽的内存和缓存,再配一颗CPU来做调度。为了数据能高效传输,就需要一条高速通道——这就是PCIe(高速串行计算机扩展总线标准)在系统中的核心角色:提供总线通道。

图:算力卡示意图
PCIe的应用范围远不止于此。CPU控制和调度芯片组,要用PCIe总线;算力卡与算力卡之间的互联,可能用到Serdes总线;计算完成的数据存入SSD硬盘,走的还是PCIe总线;算力中心里的交换机,内部CPU与Switch芯片之间的通信,同样依赖PCIe。可以说,只要是AI异构计算系统中需要高速数据传输的地方,几乎都能看到PCIe的身影。

图:PCIe总线在AI异构计算系统中的应用
所以,PCIe本质上是一种通用的总线标准,它的价值在于把AI背后的异构计算系统串联成一个整体。只要组件支持PCIe接口,研发人员就无需担心计算芯片、加速芯片、内存芯片、存储芯片、网关芯片和交换机之间的互联问题——标准统一的接口协议,大大降低了系统集成的复杂度。
那么,PCIe究竟凭什么支撑起人工智能系统的高速发展?可以从几个关键特性来看。
高效传输
数据传输速度是算力输出的生命线。PCIe的带宽不断提升,从1.0到现在的6.0版本,每一代都实现了约两倍的速率翻倍。在AI训练场景中,数以TB计的模型参数和中间数据需要在算力卡、内存和存储之间频繁搬运,PCIe的高带宽和低延迟特性直接决定了计算效率的上限。
高可扩展性
算力需求不是一成不变的。企业从小规模验证到大规模部署,需要灵活扩展算力集群。PCIe支持多通道配置(x1, x4, x8, x16),一张算力卡可以接入不同宽度的接口。更重要的是,通过PCIe交换机,可以轻松串联数十甚至上百张算力卡,构建按需扩展的计算矩阵。
实时处理能力
很多AI应用对实时性要求极高——比如自动驾驶、实时语音识别、在线推荐系统。数据从传入到推理输出,必须在毫秒级完成。PCIe点对点的高效传输,配合低延迟特性,确保了计算数据流的顺畅,不会成为系统性能瓶颈。
持续优化的低功耗性能
算力中心的功耗是个大问题。PCIe在每一代标准中都引入了更先进的电源管理机制,比如动态链路宽度调整、L1子状态等低功耗模式。在计算负载不高的场景下,PCIe链路可以自动降低速率甚至进入休眠状态,大幅节约系统能耗。
正因为PCIe连接了系统中的核心芯片、承担了数据传输的重任,它的性能可靠性就变得至关重要。实际测试中,首先需要验证PCIe接口的上传和下载峰值速度,以及稳定传输速率——这是保证高效计算的前提。接下来是电气特性测试,包括传输功耗,以及高速逻辑唤醒等低功耗功能的具体表现。

图:是德科技PCIe测试拓扑图
在接口稳定性方面,还需要测试热插拔特性、隔离度和EMC性能等因素。不过,随着算力需求的进一步增长,一些厂商已经不满足于PCIe现有的传输速度,开始自研连接标准。比如英特尔推出了基于PCIe 5.0扩展的Xe Link,用于算力卡的互联;英伟达则开发了NVLink,带宽和能效表现可以达到PCIe 5.0的数倍。这些自研方案带来了更高的测试挑战——无论是沿用PCIe协议,还是采用自研的高速互联协议,测试方案都需要覆盖全链路,确保数据传输的可靠性。

图:PCIe 6.0全链路测试方案
说到底,PCIe绝不是一个孤立的接口标准。它是整个AI算力基础设施中的“动脉”,串联起从芯片到服务器、从服务器到集群的每一环。判断一个算力系统的设计是否成熟,先看看PCIe链路的质量,往往就能窥见全貌。
