游乐游手机版
首页/科技数码/文章详情

谷歌为Gemini独造芯片 推理能效提升6至10倍

时间:2026-07-22 12:09
谷歌研发代号Frozenv2的AI芯片,专为Gemini模型设计,计划2028年部署。其推理能效(每瓦处理Token数)可达最新TPU的6-10倍,通过固化部分架构减少数据搬运,但灵活性受限。

谷歌正在筹划一项新战略:如何将Gemini与自家芯片实现更深度的绑定。

根据《The Information》援引知情人士的消息,谷歌母公司Alphabet正在研发一款内部代号为“Frozen v2”的服务器AI芯片。这款芯片专为Gemini大模型量身打造,初步计划于2028年部署上线。谷歌工程师预估,在单位功耗所能处理的Token数量上,其效率有可能达到公司最新一代自研AI芯片的6到10倍。

截至目前,谷歌并未正式确认Frozen v2项目,也未公布具体技术规格。官方在回应媒体时表示,团队一直在探索和测试提升性能与能效的新方案,但并非所有项目都会进入量产阶段。同时强调,从底层出发进行硬件与软件的协同设计,是构建高度集成系统的关键路径。不过,消息传出后,Alphabet股价在当地时间7月20日早盘上涨约3.3%。

与现有TPU相比,Frozen v2的最大不同在于进一步收窄了芯片的适用范围——它是一颗更加极致的“专用芯片”。根据现有报道,谷歌计划将Gemini的部分架构特征固化在芯片中,针对其计算路径和常用操作进行专门优化。

大模型推理不仅需要大量矩阵运算,还要频繁从高带宽内存中读取参数。数据在内存与计算单元之间反复搬运,既消耗时间也增加电力损耗。Frozen v2的目标正是降低这部分开销,从而提升响应速度,并在相同功耗下处理更多请求。至于报道中提到的6到10倍效率提升,具体指每单位功耗能处理的Token数量,而非芯片的峰值算力。

谷歌现有的TPU同样是面向机器学习的专用处理器,但需要适配不同模型,并承担训练、推理等多种任务。最新一代Ironwood单颗芯片配备192GB高带宽内存,单位功耗性能约为上一代Trillium的两倍,最多可由9216颗芯片组成Superpod。Frozen v2不会取代TPU,而是作为一条更具针对性的产品线,与之并行使用。


(来源:Google)

不过,专用芯片也有其短板:模型与芯片绑定越深,灵活性就越差。芯片从设计到投产通常需要数年时间,如果在此期间Gemini的基础架构发生较大变化,已经固化的设计可能难以适配。Frozen v2能否带来长期收益,既取决于实际能效表现,也取决于谷歌能否在快速迭代模型的同时,保持底层架构的相对稳定。

那么,谷歌为何要“铤而走险”?首要原因自然是应对持续增长的算力需求。据相关数据,谷歌内部的AI计算资源短缺已经引发不同团队之间的资源竞争,Google Cloud甚至因此拒绝过部分外部客户订单。

大模型的计算需求包括训练和推理两个阶段。训练先进模型需要集中投入大量算力,但随着Gemini被嵌入搜索、办公软件、云服务和智能终端,长期发生的推理可能形成更庞大的成本。单次生成费用看似有限,但乘以数以亿计的用户和持续增长的调用量,电力、芯片、网络及数据中心投入都会成为重要的支出项。

Alphabet已将2026年资本开支预期上调至1800亿至1900亿美元,主要用于扩建AI计算能力、数据中心和相关基础设施。在这一背景下,提高每瓦电力所能生成的Token数,不仅意味着更低的能耗,还意味着同一座数据中心能承载更多用户请求。对于已经拥有大量Gemini使用场景的谷歌来说,即使单次推理成本只下降一小部分,规模化之后也能带来可观的节省。


图|谷歌历年资本开支预期(来源:S&P)

自研芯片还能加强谷歌对供应链和产品节奏的控制,减少对英伟达等外部芯片供应商的依赖。但这种“减少依赖”并不等于完全替代。Frozen v2即使顺利投产,预计规模也会低于TPU;谷歌的数据中心仍会同时使用TPU、GPU及其他计算设备。它更像是为高频且相对稳定的Gemini任务增加一类成本更低的专用工具。

谷歌并非唯一走向自研芯片的AI公司。2026年6月,OpenAI与博通公布了首款自研推理芯片Jalapeño。OpenAI表示,这款芯片围绕大语言模型推理设计,将结合博通的芯片实现和网络技术以及Celestica的服务器系统能力,计划于2026年底开始部署。


(来源:OpenAI)

Anthropic也被曝已开始研究自有AI芯片,并与三星电子等潜在合作方接触。不过项目仍处于早期阶段,芯片的用途、性能目标和部署方式尚未明确。Anthropic同时表示,亚马逊Trainium、谷歌TPU和英伟达GPU仍将是其扩张算力的重要基础。中国方面,此前DeepSeek和近期的月之暗面也有自研芯片方面的传闻。

除了专注基础模型的公司,亚马逊、微软、Meta、阿里巴巴、百度和字节跳动等拥有云服务或大规模互联网业务的企业,也在不同程度推进专用AI芯片。其中部分芯片服务于模型训练,部分集中于推理、推荐和广告等高频工作负载。它们共同反映出一个趋势:随着AI服务规模扩大,掌握模型的公司越来越希望同时参与芯片和计算系统设计。

这些项目属于同一轮趋势:AI公司希望根据自身模型和业务负载设计芯片,以获得更好的成本、能效和供应保障。但它们并不完全相同。Trainium、Maia、MTIA以及OpenAI的Jalapeño主要面向一类或多类AI工作负载,仍保留一定通用性;而Frozen v2则称会把Gemini的部分架构直接固化进硬件,模型与芯片的绑定程度可能更高。

因此,Frozen v2所代表的不仅仅是谷歌扩大自研芯片投入,更是一项激进的软硬件协同试验。答案将取决于芯片能否如期投产,也取决于到2028年时,Gemini是否仍然适合这块为它提前设计的硅片。

来源:https://www.163.com/dy/article/L2CM9DA905119734.html
上一篇歌尔AI场景化应用,长期技术储备筑牢增长壁垒 下一篇惠普星Studio Pro 27英寸一体机Ultra5 32G 1T 9399元
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
罗福莉入选新一届35岁以下科技创新35人中国区名单
科技数码 · 2026-07-25

罗福莉入选新一届35岁以下科技创新35人中国区名单

2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。

美国科技巨头为AI投资年内裁员近14万人
科技数码 · 2026-07-25

美国科技巨头为AI投资年内裁员近14万人

美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。

位AI Infra高管复盘WAIC:暴力美学触顶后求变?
科技数码 · 2026-07-25

位AI Infra高管复盘WAIC:暴力美学触顶后求变?

WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。

显卡厂商封仓引发涨价 玩家面临高价购买
科技数码 · 2026-07-25

显卡厂商封仓引发涨价 玩家面临高价购买

显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542

OpenAI加入签署AI开源模型公开信,组织达35家
科技数码 · 2026-07-25

OpenAI加入签署AI开源模型公开信,组织达35家

7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。