在大模型训练与推理场景中,随着集群规模扩展至千卡甚至万卡级别,性能瓶颈成为必须攻克的难题。算力利用率能否达到理论峰值?显存是否足够支撑大规模并行?线性扩展效率是否出现下降?业界并不缺乏数据,但一直缺少统一的评估标准。中国信通院此次行动旨在填补这一空白——依托人工智能软硬件协同创新与适配验证中心(位于北京经开区国家信创园),基于AISHPerf人工智能软硬件基准体系,正式启动了“AISHPerf大模型训推工程实践性能基准研究工作”。
该工作的目标十分明确:建立基准、汇聚数据、推动优化。重点围绕千卡至万卡规模的集群,针对训练与推理环节的核心性能瓶颈,系统梳理出关键指标——包括模型算力利用率、显存利用率、线性扩展效率、有效训练时间占比、首词元时延、吞吐量、显存带宽利用率等。不仅给出明确定义,还将结合业界公开的技术报告与实测数据,提供经验值区间。换言之,这套基准将成为行业内可引用、可对标、可追溯的工程性能参考,为可信智算体系的规范化发展提供切实可行的支撑。

