Google在高性能处理器与AI芯片领域拥有两大核心系列:TPU系列(Tensor Processing Unit),主要针对服务器端的AI模型训练与推理,广泛应用于Google云计算和数据中心;以及Tensor系列,专为手机端的AI模型推理设计,搭载于Pixel智能手机。
本文汇总了Google近年来在HotChips、ISCA、ISSCC等顶级会议和期刊上发表的论文与报告,系统梳理了Google TPU芯片的发展历程与硬件架构,可作为学习与研发高性能处理器及AI芯片的宝贵参考资料。
1. TPUv1
定位:Google第一代TPU芯片,专用于服务器端的推理任务。
硬件架构




功能特性
- TPU指令通过PCIe Gen3 x16总线从主机发送到指令缓冲区。
- 矩阵乘法单元(Matrix Unit)是TPU的核心,包含256x256个MAC,可对有符号或无符号整数执行8位乘法和加法。16位乘积被收集在矩阵单元下方的32位累加器的4 MiB中。4 MiB表示4096×256个元素的32位累加器。矩阵单元在每个时钟周期产生一个256元素的部分和。
- 当混合使用8位权重和16位激活(反之亦然)时,矩阵单元以半速计算;当两者都是16位时,以四分之一速度计算。
- 省略了稀疏架构支持。稀疏性将在未来的设计中占据高度优先地位。
- TPU指令遵循CISC传统,包括重复字段。这些CISC指令的平均每条指令时钟周期(CPI)通常为10到20。总共约有12条指令,其中以下5条是关键指令:
- Read_Host_Memory
- Read_Weights
- MatrixMultiply/Convolve
- Activate
- Write_Host_Memory
