在WAIC 2026现场,阿里平头哥正式宣布开源其自研AI软件栈T-Head SAIL。该软件栈作为真武系列AI芯片的底层软件,拥有独立自主知识产权,同时全面兼容主流AI生态,覆盖从OS层、SDK层到接口层的完整链路。
源码、驱动、工具链及文档已同步开放,全球开发者可通过平头哥开发者社区下载。
截至2026年4月,真武AI芯片累计出货量达56万片,已服务于20多个行业的400余家客户。这套软件栈已在阿里云及多家行业企业的生产环境中经过充分验证,包括双11级别的大规模流量洪峰以及复杂场景下的严苛SLA要求。
软件栈架构:五层完整技术栈
SAIL开源了一套经过生产环境验证的五层技术栈,从底层驱动到顶层运维工具实现了完整覆盖。
驱动与运行时层:包含PPU Runtime和PPU Driver(用户态驱动UMD与内核态驱动KMD),负责操作系统与真武芯片的识别、调度和内存管理,是芯片与操作系统交互的基础层。
编程语言层:开放C/C++和Python接口,与主流生态全面对齐,开发者无需学习新语言或更换编程范式,现有代码资产可平滑迁移。
编译器层:包含Compiler与Debugger,支持从模型图到可执行代码的端到端编译优化,开发者可查看中间表示,深入理解模型在具体场景中的优化过程。
高性能库层:计算库包括线性代数加速库acBLAS、快速傅立叶变换库acFFT、随机数生成库acRAND、稀疏矩阵加速库acSPARSE、深度神经网络加速库acDNN、求解器acSOLVER等全套数学和AI基础库;编解码库包含HGENC、HGDEC、HGJPEG与HGPP;集合通信库PCCL与sailSHMEM针对多卡、多机分布式训练而设计;此外还有acext扩展库与HGML机器学习库。
开发工具层:包括Asight Compute(算子级性能分析)、Asight Systems(系统级全栈Profiling)、PPU-SMI(设备实时监控与管理)、PPU-DCGM(集群级资源调度)。
三大迁移优势
无需重写代码:SAIL全面兼容主流AI生态,主流模型即开即用,算子库完整对标,开发者经验与代码资产可直接复用。
无需等待适配:平头哥自研推理引擎提供开箱即用的生产级性能,对主流AI推理框架的平均适配时间小于7天。
无需绑定框架平台:SAIL已全面适配PyTorch、TensorFlow、vLLM、SGLang等260余个主流训练与推理框架,工具链支持按需选用,不绑定特定技术路线。
业务背景与产品线
平头哥于2018年成立,2019年推出首颗AI推理芯片含光800,推理性能达78563 IPS,应用于双11淘宝主搜场景。2021年云栖大会上发布通用服务器CPU倚天710,性能超过同期业界标杆20%,能效比提升超过50%,已通过阿里云广泛应用于视频编解码、高性能计算、游戏等领域。
真武810于2022年底至2023年初完成研发和场景验证,采用并行计算架构和片间互联技术,配备96GB HBM2e内存、700GB/s片间互联带宽,支持PCIe 5.0×16接口,功耗400W,已大规模用于千问大模型的训练和推理。
2026年阿里云峰会上,平头哥发布新一代训推一体AI芯片真武M890,内置144GB显存,片间互联带宽提升至800GB/s,整体性能是真武810E的3倍,原生支持FP32高精度训练到FP4低精度推理。同时发布自研ICN Switch 1.0芯片,可实现64卡全带宽互联。
平头哥芯片版图已覆盖算力(真武系列AI芯片、倚天系列Arm服务器CPU)、网力(ICN Switch互联芯片、磐脉系列智能网卡)、存力(镇岳系列存储主控芯片,如SSD主控芯片镇岳510)。
后续安排
平头哥在本次开源中提出,将与全球开发者、科研机构及产业伙伴共同打磨工具链、丰富算子生态、优化性能体验。T-Head SAIL中的SAIL全称为Seed of AI Library,平头哥将每一行开源代码视为蕴含可能性的种子,期待通过共建推动国内AI生态发展。
本文信息基于原始资料记录时的状态,模型版本、产品功能、价格、企业合作和政策可能继续变化,实际情况以相关主体最新公开信息为准。
