腾讯混元AI Infra团队近日正式开源了HPC-Ops,这是一款面向生产环境的大语言模型(LLM)推理核心算子库。该库专为解决大模型工业级部署中常见的“性能瓶颈、高延迟、优化困难”等痛点而设计。它并非基于现有框架简单封装,而是从零开始,基于CUDA和CuTe进行深度重构,融合了工程架构的抽象设计、GPU微架构的针对性适配以及指令级精细调优。其核心目标在于降低底层算子开发门槛的同时,将关键算子的性能推向硬件极限。这并非微调优化,实测数据已充分证实其效果。
据官方介绍,HPC-Ops是一套轻量级、高吞吐量、低延迟的LLM推理算子集合,专为大规模模型服务场景量身定制。其核心模块包括融合专家混合(FusedMoE)、注意力机制(Attention)、节点内及跨节点通信(Intra-/Inter-node Communication)、归一化(Norm)、采样器(Sampler)以及多种高频小算子的深度融合实现。团队的关键贡献在于:他们深入分析了典型推理任务的数据流特征与GPU微架构特性,并据此精准匹配计算划分策略与底层指令执行模型,从而最大化并行效率。同时,通过工程代码层面的合理抽象,算法工程师能够更专注于模型逻辑与算子语义,显著降低后续迭代与维护成本——这对实际业务而言,具有真正的价值。
下面来看实际数据。腾讯混元AI Infra团队公布的测试结果表明,在真实业务负载场景下,集成HPC-Ops后,混元系列模型的推理QPM(每分钟查询数)提升了30%,DeepSeek系列模型的QPM提升了17%。单个算子的性能表现尤为突出:Attention算子相比FlashInfer/FlashAttention最高加速2.22倍;GroupGEMM相比DeepGEMM最高加速1.88倍;FusedMoE相比TensorRT-LLM最高加速1.49倍。这些数据并非实验室理想环境下的结果,而是从真实业务负载中压榨出的硬核指标。

