谷歌这次拿出的Trillium芯片,可以说是把AI算力的天花板又往上捅了一个台阶。作为第六代TPU产品,它在单个芯片上的峰值计算性能比上一代TPU v5e提升了4.7倍——这可不是简单的小步迭代,而是实打实的代际跨越。更值得注意的是,在性能大幅跃升的同时,功耗反而降低了67%以上,能效比的控制做得相当出色。

除了核心算力的提升,Trillium在存储和架构层面也有几处关键升级。高带宽存储(HBM)的容量和整体带宽都翻了一番,这意味着可以装载更大参数的模型,以及更大的键值缓存。矩阵乘单元(MXU)的尺寸被放大,时钟速度也拉高了,再加上第三代SparseCore的引入,整个芯片的数据处理能力上了一个大台阶。
说到SparseCore,它算是Trillium一个比较关键的差异化设计。简单理解,这是一种专门处理超大型嵌入计算的专用翻跟斗——在高级排序和推荐类任务中,这类工作负载特别常见。通过把那些随机且细粒度的访问请求从张量核心中卸下来,SparseCore相当于给芯片配了一个专门干“脏活累活”的小帮手,让主核心能更专注地处理高密度计算任务。HBM带宽翻倍之后,Trillium在处理大模型时也能更从容。
Alphabet首席执行官桑达尔·皮查伊给出了一个耐人寻味的数字:过去六年,行业对机器学习算力的需求增长了100万台,每年大约增长10倍。Trillium的推出,显然是为了接住这股仍在往上猛蹿的需求。不过谷歌并不直接销售芯片,而是通过自家云平台来出租使用权。按照规划,这款芯片将从2024年末开始向云客户提供服务,主要用来支撑大模型的文本生成、多媒体内容生成这类高计算密度的任务。
在架构扩展方面,Trillium支持在单个高带宽、低延迟的Pod中扩展到256个TPU,并且可以进一步堆叠到数百个Pod。这种扩展能力让它可以应对更复杂、规模更庞大的AI任务——对于持续追求更大模型、更高精度的行业而言,这条路几乎是必经之地。
总的来看,Trillium在性能上打了个漂亮的翻身仗,同时在能效、存储和专用加速等维度也都拿出了实质性改进。对于未来几年AI落地场景的演进,它应该会扮演一个相当关键的角色。
