人工智能点燃算力需求,AI服务器迎来机遇——这个判断在今天几乎已经成了行业共识。ChatGPT的火爆,让大模型和AI算力这两个词彻底出了圈。从刷高情商对话到自动生成代码,再到构思剧本和小说,大语言模型展现出的能力让全球科技巨头纷纷拥抱AIGC,相关技术和应用层出不穷。
回看整个AIGC产业,生态体系的雏形已经显现,大致可以划分为上中下三层架构。上层是基础层,以预训练模型为核心,构建起整个技术基础设施;中间层则是垂直化、场景化、个性化的模型与应用工具;最下面是应用层,面向终端用户提供文字、图片、音视频等内容生成服务。

根据IDC发布的《2022年第四季度中国服务器市场跟踪报告Prelim》,浪潮在国内市场依旧领跑,新华三次之,超聚变位列第三,中兴通讯则成功跻身前五。
服务器基本构成
一台服务器内部到底是怎么构成的?我们来拆解一下。核心硬件包括处理器、内存、芯片组、I/O设备(RAID卡、网卡、HBA卡)、硬盘,以及机箱(电源、风扇)。以普通服务器生产成本为例,CPU及芯片组的成本占比大约在50%左右,内存约占15%,外部存储约10%,其他硬件合计约25%。

从逻辑架构上看,服务器和普通计算机其实大同小异。只不过为了支撑高性能计算,服务器在处理能力、稳定性、可靠性、安全性、可扩展性以及可管理性等方面要求更高。逻辑架构中,CPU和内存是最核心的两个部分——CPU负责逻辑运算,内存负责数据存储管理。固件方面主要包括BIOS或UEFI、BMC、CMOS,操作系统则覆盖32位和64位。
大模型参数量持续提升
为什么说大模型是算力“怪兽”?核心在于参数量的持续膨胀。拿GPT系列和BERT、T5模型对比,参数量提升非常明显。GPT-3是目前最大的知名语言模型之一,包含了1750亿个参数;而在它之前,最大的语言模型是微软的Turing NLG,也只有170亿个参数。训练数据量在不断加大,对算力资源的需求自然水涨船高。
回顾GPT的发展历程——GPT家族和BERT模型都是基于Transformer技术的知名NLP模型。GPT是一种生成式预训练模型,由OpenAI团队在2018年首次发布。最初的GPT-1只有12个Transformer层,到了GPT-3,层数增加到了96层。GPT-1采用的是无监督预训练加有监督微调的方式,而GPT-2和GPT-3则完全是纯无监督预训练。GPT-3相比GPT-2的核心进化,就是数据量和参数量实现了数量级的飞跃。
未来异构计算或成为主流
异构计算这个词,近些年出现的频率越来越高。它指的是使用不同类型指令集和体系架构的计算单元组成系统,目前主要包括GPU云服务器、FPGA云服务器和弹性加速计算实例EAIS。思路很直接——让最合适的硬件去服务最适合的业务场景。

在CPU+GPU的异构计算架构中,GPU和CPU通过PCIe总线连接协同工作。CPU所在位置称为主机端(host),GPU所在位置称为设备端(device)。这套组合可以做到优势互补:CPU负责处理逻辑复杂的串行程序,GPU则专门应对数据密集型的并行计算任务,各司其职,发挥最大功效。如今,越来越多的AI计算都在采用异构计算来提升性能。
举个例子,阿里第一代计算型GPU实例(GN4)在2017年对外发布,搭载的是Nvidia M40翻跟斗。在万兆网络下面向人工智能深度学习场景,相比同时代的CPU服务器,性能提升了将近7倍。
为什么GPU适用于AI
CPU适用的工作负载范围很广,尤其是那些对延迟和单核性能要求较高的场景。作为强大的执行引擎,CPU把数量相对较少的内核集中在处理单个任务上,讲究的是快速完成。这使得它特别适合从串行计算到数据库运行等各种任务。
GPU最初是作为专门加速3D渲染任务的ASIC开发的,功能相对固定。但随着时间推移,这些引擎变得越来越可编程、越来越灵活。虽然图形处理和顶级游戏的视觉效果仍然是GPU的主战场,但它已经演化为一种更通用的并行处理器,可以处理越来越多的应用程序。


这里要注意,训练和推理过程处理的数据量是完全不同的。在AI实现的过程中,训练和推理缺一不可,但两者的区别很大。
训练过程,也叫学习过程,是通过大量数据训练出一个复杂的神经网络模型,确定网络中权重和偏置的值,使其能够适应特定功能。推理过程,也就是判断过程,是利用训练好的模型,用新数据推导出各种结论。
简单理解,我们学习知识的过程就像训练——为了掌握大量知识,必须读很多书、听老师讲解、做大量习题来巩固理解,再通过考试来验证学习成果。分数高低就是学习效果的差别,考不过就要重新来,不断提升对知识的掌握程度。而推理则是应用所学知识进行判断,好比医生诊断时用学到的医学知识分析病情,推导出病因。
训练需要密集的计算。神经网络算出结果后,如果发现错误或者没达到预期,这个错误会通过网络层反向传播回来。网络需要尝试重新推测,每一次尝试都要调整大量参数,同时兼顾其他属性。然后再次推测、再次校验,循环往复,直到得到“最优”的权重配置。如今神经网络的复杂度越来越高,一个网络的参数可以达到百万级别,每一次调整都意味着巨大的计算量。吴恩达曾经举过一个例子:训练一个百度的汉语语音识别模型,不仅需要4TB的训练数据,在整个训练周期中还需要20 exaflops(百亿亿次浮点运算)的算力。所以说,训练就是一头消耗巨量算力的“怪兽”。

推理则是利用训练好的模型,用新数据推导出各种结论。它借助神经网络模型进行运算,用输入的新数据“一次性”获得正确结论。和训练不同,它不需要循环往复地调整参数,因此对算力的需求也低得多。

推理方面,NVIDIA T4 GPU是个常用选择。它为不同的云端工作负载提供加速,包括高性能计算、深度学习训练和推理、机器学习、数据分析和图形学。T4引入了革命性的Turing Tensor Core技术,用多精度计算应对不同工作负载。从FP32到FP16,再到INT8和INT4的精度,T4的性能比CPU高出40倍,实现了性能的重大突破。

训练方面,A100和H100是主力。对于数据表庞大的超大型模型,A100 80GB可以为每个节点提供高达1.3TB的统一显存,吞吐量比A100 40GB多出3倍。在BERT这类先进的对话式AI模型上,A100的推理吞吐量可以达到CPU的249倍。
推算ChatGPT带来的服务器需求增量
H100的性能更强。与上一代产品相比,H100的综合技术创新可以把大型语言模型的速度提高30倍。根据Nvidia的测试结果,H100针对大型模型提供高达9倍的AI训练速度,超大模型的AI推理性能提升高达30倍。在数据中心级部署H100 GPU,可以实现出色的性能,让研究人员轻松使用新一代百亿亿次级(Exascale)高性能计算(HPC)和万亿参数的AI。
H100还采用了DPX指令,性能比NVIDIA A100 Tensor Core GPU高7倍。在动态编程算法(比如用于DNA序列比对的Smith-Waterman算法)上,H100比仅使用传统双路CPU的服务器快40倍。
假设我们用H100服务器进行训练,单台服务器的AI算力性能为32 PFLOPS,最大功率为10.2 kw。测算下来,训练阶段需要服务器数量等于训练阶段算力需求除以服务器AI算力性能。结果是4.625×10⁷台同时工作1秒,换算一下,大约需要535台服务器工作1天。
根据天翼智库的数据,GPT-3模型参数约1750亿个,预训练数据量为45 TB,折合成训练集约3000亿tokens。按照有效算力比率21.3%来计算,训练阶段的实际算力需求为1.48×10⁹ PFLOPS。
对AI服务器训练阶段的需求做敏感性分析,主要看两个变量:一是同时并行训练的大模型数量,二是单个模型要求训练完成的时间。按A100服务器5 PFLOPs、H100服务器32 PFLOPs来计算,如果不同厂商需要训练10个大模型并在1天内完成,那么需要A100服务器34233台,或者需要H100服务器5349台。另外,如果后续GPT模型的参数继续迭代向上增长(GPT-4的参数量可能比GPT-3有倍数级提升),那么所需的AI服务器数量还会进一步增加。
AI服务器市场规模预计高速增长
AI服务器作为算力基础设备,其需求有望受益于AI时代对算力不断提升的需求。根据TrendForce的数据,截至2022年,搭载GPGPU的AI服务器年出货量占整体服务器的比重接近1%。在ChatBot相关应用的加持下,这个市场有望进一步升温,预估出货量年增长率可达8%;2022到2026年的复合增长率将达到10.8%。
AI服务器属于异构服务器,根据应用范围可以采用不同的组合方式,比如CPU+GPU、CPU+TPU、CPU+其他加速卡等。IDC预计,中国AI服务器2021年的市场规模为57亿美元,同比增长61.6%;到2025年,这个数字将增长到109亿美元,CAGR达到17.5%。
AI服务器构成及形态
以浪潮NF5688M6服务器为例,它采用NVSwitch实现GPU跨节点P2P高速通信互联。整机配备8颗NVIDIA Ampere架构GPU,通过NVSwitch实现跨节点高速通信。配置2颗第三代Intel Xeon可扩展处理器,支持8块2.5英寸NVMe SSD或SATA/SAS SSD,板载2块SATA M.2。可以选配1张PCIe 4.0 x16 OCP 3.0网卡,速率支持10G/25G/100G;支持10个PCIe 4.0 x16插槽、2个PCIe 4.0 x16插槽(PCIe 4.0 x8速率)、1个OCP3.0插槽;支持32条DDR4 RDIMM/LRDIMM内存,速率最高支持3200MT/s。物理结构还包括6块3000W 80Plus铂金电源、N+1冗余热插拔风扇、机箱等。
目前,按照GPU数量的不同,市场上有4颗GPU(浪潮NF5448A6)、8颗GPU(Nvidia A100 640GB)以及16颗GPU(NVIDIA DGX-2)的AI服务器可供选择。
AI服务器产业链
AI服务器的核心组件包括GPU(图形处理器)、DRAM(动态随机存取存储器)、SSD(固态硬盘)和RAID卡、CPU(中央处理器)、网卡、PCB、高速互联芯片(板内)以及散热模组等。

CPU的主要供货商是Intel;GPU领域,国际巨头英伟达领先,国内厂商如寒武纪、海光信息也在发力。内存方面,三星、美光、海力士是主力,国内则有兆易创新等。SSD厂商同样以三星、美光、海力士为主,国内包括江波龙等。PCB厂商海外有金像电子,国内代表则有沪电股份、鹏鼎控股等。主板厂商包括工业富联,服务器品牌厂商则包含浪潮信息、紫光股份、中科曙光、中兴通讯等。
AI服务器竞争格局
IDC发布的《2022年第四季度中国服务器市场跟踪报告Prelim》显示,前两名浪潮与新华三的变化不大,第三名超聚变的表现尤为抢眼,份额从3.2%一跃升至10.1%,增幅远超其他厂商。在Top8服务器厂商中,浪潮、戴尔、联想均出现显著下滑,而超聚变和中兴则取得了明显增长。具体来看,浪潮的份额从30.8%下降到28.1%;新华三从17.5%略降至17.2%;中兴通讯从3.1%提升到5.3%,位居国内第五。联想的降幅最明显,从7.5%直降到4.9%。
据TrendForce集邦咨询统计,2022年AI服务器采购占比中,北美四大云端业者Google、AWS、Meta、Microsoft合计占66.2%。而中国近年来随着国产化力度加强,AI建设浪潮也在升温。其中,ByteDance的采购力度最为突出,年采购占比达6.2%;紧随其后的是Tencent、Alibaba与Baidu,分别约为2.3%、1.5%和1.5%。
国内AI服务器的竞争者主要包括浪潮信息、新华三、超聚变、中兴通讯等。

服务器主要厂商则包括工业富联、浪潮信息、超聚变、紫光股份(新华三)、中兴通讯、中科曙光。目前在AI服务器领域,工业富联和浪潮信息处于领先位置,浪潮信息在阿里、腾讯、百度的AI服务器占比高达90%。
紫光股份在GPU服务器市场处于领先地位,拥有多种类型的GPU服务器来满足不同的AI应用场景。针对GPT场景优化的GPU服务器已经完成开发,并取得了31项世界领先的测试指标,新一代GPU服务器将在今年二季度全面上市。
中兴通讯近年服务器业务发展较快,年初推出了AI服务器G5。此外,还在布局新一代AI加速芯片和模型轻量化技术,旨在大幅降低大模型的推理成本。
