游乐游手机版
首页/AI热点日报/热点详情

谷歌TPU芯片的发展历史与硬件架构深度解析

类型:热点整理2026-07-20
TPU系列演进:v1专用于推理的矩阵乘法单元;v2 v3引入VLIW架构与bfloat16,支持训练;v4i v4采用光路交换机与稀疏计算,优化大规模集群通信。该系列始终体现软硬件协同设计,从专用加速到通用训练再到超大规模集群部署。

Google在高性能处理器与AI芯片领域拥有两大核心系列:TPU系列(Tensor Processing Unit),主要针对服务器端的AI模型训练与推理,广泛应用于Google云计算和数据中心;以及Tensor系列,专为手机端的AI模型推理设计,搭载于Pixel智能手机。

本文汇总了Google近年来在HotChips、ISCA、ISSCC等顶级会议和期刊上发表的论文与报告,系统梳理了Google TPU芯片的发展历程与硬件架构,可作为学习与研发高性能处理器及AI芯片的宝贵参考资料。

1. TPUv1

定位:Google第一代TPU芯片,专用于服务器端的推理任务。

硬件架构

功能特性

  • TPU指令通过PCIe Gen3 x16总线从主机发送到指令缓冲区。
  • 矩阵乘法单元(Matrix Unit)是TPU的核心,包含256x256个MAC,可对有符号或无符号整数执行8位乘法和加法。16位乘积被收集在矩阵单元下方的32位累加器的4 MiB中。4 MiB表示4096×256个元素的32位累加器。矩阵单元在每个时钟周期产生一个256元素的部分和。
  • 当混合使用8位权重和16位激活(反之亦然)时,矩阵单元以半速计算;当两者都是16位时,以四分之一速度计算。
  • 省略了稀疏架构支持。稀疏性将在未来的设计中占据高度优先地位。
  • TPU指令遵循CISC传统,包括重复字段。这些CISC指令的平均每条指令时钟周期(CPI)通常为10到20。总共约有12条指令,其中以下5条是关键指令
    • Read_Host_Memory
    • Read_Weights
    • MatrixMultiply/Convolve
    • Activate
    • Write_Host_Memory
    其他指令包括备用主机内存读/写、设置配置、两个版本的同步、中断主机、调试标记、nop和暂停。

来源:https://m.elecfans.com/article/2272412.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。