最近,SPEC第35届年会在美国落下帷幕,会上传出一个重要消息:国际最新AI算力评测标准SPEC ML即将正式发布。这项标准由浪潮信息、NVIDIA、Intel、AMD、Red Hat等多家核心成员联合开发,将直接推动AI算力产业进入更规范、更透明的评测时代。
与市面上常见的AI算力评测基准不同,SPEC ML最大的特点在于——它模拟了AI训练和推理的端到端全栈流程,覆盖了当前业界最丰富的主流AI工作负载。换句话说,它不只是看某个单一场景下的极限性能,而是综合评估多个AI场景下的性能、集群扩展性、能效等关键参数。这就像买车,不能只看最高时速,还得看油耗、空间、舒适度,才能真正判断一辆车合不合适。目前,浪潮信息、NVIDIA、Dell等企业已经率先针对SPEC ML展开测试工作,这项标准的发布,将帮助用户更全面地了解AI算力系统的真实表现,找到系统瓶颈并针对性优化。
此外,SPEC ML技术委员会完成了换届选举,浪潮信息和英特尔分别连任技术委员会主席和副主席,这也在一定程度上体现了中国企业在国际标准制定中的持续影响力。

回到产业背景。过去十年,AI算力需求增长了超过100万倍,尤其是ChatGPT这类大模型的出现,参数规模动辄千亿甚至万亿,对算力系统的要求远超以往。为了衡量不同芯片、算法、计算框架的AI性能,业界陆续推出了MLPerf、AIPerf、DeepBench等基准测试。但这些基准有一个共同的问题:它们往往只关注单一场景下的极限性能,比如训练场景中直接跳过耗时的预训练过程,仅测试ResNet50、Transformer、BERT等某个模型。然而,随着模型规模越来越大,训练流程越来越复杂,从单节点到大规模集群,模态算法也日益丰富,用户真正需要的是一个能模拟真实训练和推理全流程的评测基准,系统评估算力系统在多种AI工作负载下的综合性能、集群扩展性以及能效。
正是基于这一需求,SPEC ML技术委员会在过去一年完成了新标准的开发工作。在测试设计上,无论是训练场景还是推理场景,SPEC ML都会模拟用户真实的应用环境,综合评估服务器整机在ResNet、Yolo、SSD、3D U-Net、MobileNet、BERT等10多种AI工作负载下的性能,同时考察多节点集群的扩展能力、能效以及关键系统参数。特别值得一提的是,Diffusion、Bloom等最新负载的加入,使得对AIGC、大模型等热点应用的性能评测成为可能,这对于正在选型或搭建AI基础设施的用户来说,参考价值非常大。在本次大会上,SPEC ML技术委员会展示了完整的测试工具架构、功能及结果呈现,获得了SPEC领导层及各成员的高度评价。
说到SPEC,它本身是全球权威的第三方应用性能测试组织,成员包括英特尔、甲骨文、NVIDIA、苹果、微软、浪潮信息、加州大学伯克利分校、清华大学等。旗下拥有SPEC CPU、SPEC Power、SPEC Cloud等十几项测试基准,真实模拟了企业不同应用场景下的整机性能和能效,是企业采购和信息系统搭建的重要决策依据。作为新一届SPEC OSSC委员,浪潮信息将继续承担SPEC ML、SPEC CPU、SPEC Power、SPEC Cloud等技术小组的日常工作审查、重大事项决策以及测试标准发展方向的研究工作。
