谷歌正在研发一款专为Gemini AI模型量身打造的新型服务器芯片,其核心思路非常直接——将模型架构直接固化在硅片上,以此换取更快的推理速度和更低的功耗。
据科技媒体The Information周一报道,这款内部代号为“Frozen v2”的芯片,其效率预计可达现有自研芯片的6到10倍,最早有望在2028年投入部署。
消息源透露,该项目的直接驱动力来自谷歌内部日益严峻的AI算力短缺问题——这一问题已引发内部矛盾,甚至迫使谷歌云拒绝部分外部客户。Frozen v2的思路是,将Gemini模型的某些决策逻辑预先嵌入芯片,减少运行时的计算步骤和数据搬运,从而带来更快的响应和更低的单位功耗。
谷歌发言人在声明中表示,团队“持续研究和探索新创新,以为用户和客户提供最高性能与效率”,同时补充说“并非每个项目都会进入量产,但这种严格的探索是我们全栈方法的核心”。
消息传出后,谷歌股价周一盘中一度上涨3.7%,最终收涨1.52%。

01
专用推理芯片:效率优先的架构赌注
Frozen v2的核心设计理念,本质上是将Gemini模型的底层架构永久刻入芯片,使其在处理推理请求时,无需像通用芯片那样进行大量实时决策。
以每单位功耗能处理的token数量来衡量,其效率预计是谷歌最新一代自研AI芯片的6到10倍。
这与通用AI芯片的逻辑截然不同。谷歌现有的TPU与英伟达GPU类似,设计上兼容多种模型,因此运行特定模型时,需要处理大量动态决策过程。Frozen v2通过预先固化部分决策,换来了更高的运行效率,代价是通用性有所降低。
谷歌正在评估应该将多少信息固化在芯片中,以在灵活性和效率之间寻找平衡。知情人士指出,Frozen v2只能兼容与设计时相同底层架构的Gemini后续版本,这意味着谷歌实际上是在押注自己会长期沿用当前的Gemini架构。谷歌表示,芯片可以支持模型权重的更新,即决定模型如何响应的参数设置。
02
项目沿革:从“全固化”到“弹性固化”
Frozen项目并非全新概念。据称,其前身是谷歌DeepMind首席科学家Jeff Dean主导的“原版Frozen”方案,计划将模型权重直接烧录进芯片。但这样一来,芯片只能服务一个特定版本的Gemini,生命周期过短,因此被搁置。
Frozen v2在此基础上进行了调整,转向“弹性固化”——固化模型架构,而非具体权重,既保留了效率优势,又延长了芯片的使用周期。
在行业参照上,加拿大芯片初创公司Taalas采用了类似的设计理念,将特定AI模型硬编码进芯片,已融资超过2亿美元。相比之下,SambaNova、d-Matrix以及OpenAI、微软等公司也在开发推理芯片,但技术路径不同。英伟达去年12月斥资200亿美元与推理芯片初创公司Groq达成技术授权,强化其在推理市场的布局。
03
定位:TPU之外的新分支,而非替代品
谷歌明确将Frozen v2定位为TPU之外的新分支,而非替代现有自研芯片。TPU与英伟达GPU一样属于通用AI芯片,兼容多种模型;Frozen v2专为Gemini打造,两条线将并行发展。
目前谷歌没有计划将Frozen v2扩产到与TPU相当的体量。知情人士表示,相对有限的部署规模,使谷歌可以在项目后期再引入外部设计和制造合作伙伴,无需像重大产品发布那样提前大规模统筹。而且,这一代产品某种程度上也是一项工程试验——为工程师积累开发更高专用化芯片的经验,尤其是在AI模型架构逐渐趋于稳定的背景下。
谷歌现有的自研芯片战略已初见成效。今年,谷歌发布了第八代TPU,并开始直接向云计算客户销售,向英伟达的主导地位发起挑战。谷歌已与Meta签署了数十亿美元规模的TPU租用协议,还在积极争取其他云服务提供商的客户。知情人士表示,自研芯片让谷歌能以更低成本运行Gemini模型——如果Frozen v2成功,这一成本优势可能会进一步放大。
