游乐游手机版
首页/AI热点日报/热点详情

AMD携手Cerebras低时延AI推理 每瓦Token吞吐提升5倍

类型:热点整理2026-07-24
AMD与Cerebras在Advancing AI 2026活动上正式宣布联手,共同开发AI推理解决方案。这一消息引发业界广泛关注——两家风格迥异的公司携手合作,究竟能带来怎样的突破? 根据官方新闻稿,该方案核心聚焦超低延迟AI推理场景。具体而言,它将AMD的Helios机架级解决方案与Cerebr

AMD与Cerebras在Advancing AI 2026活动上正式宣布联手,共同开发AI推理解决方案。这一消息引发业界广泛关注——两家风格迥异的公司携手合作,究竟能带来怎样的突破?

AMD携手Cerebras押注低时延AI推理:每瓦每秒Token吞吐提升5倍

根据官方新闻稿,该方案核心聚焦超低延迟AI推理场景。具体而言,它将AMD的Helios机架级解决方案与Cerebras的晶圆级引擎深度融合,目标明确——应对英伟达与Groq的联合竞争。

从双方披露的路线图来看,Helios机架扮演着“高性能、可扩展吞吐引擎”的角色,主要负责处理提示词和大上下文窗口。而Cerebras的Wafer-Scale Engine则专攻对内存带宽要求更高的Token生成与解码环节,强调超低时延表现。两个计算引擎协同工作,预计能将每瓦每秒的Token吞吐量提升5倍。这两套硬件的分工相当清晰。

为什么Cerebras的Wafer-Scale Engine在此环节能脱颖而出?原因在于它把数十万个计算核心和数十GB的SRAM集成在单块互连硅片上,几乎消除了外部网络瓶颈。数据在芯片内部流转,延迟自然大幅降低,这对超低延迟推理场景来说价值不言而喻。

来源:https://tech.ifeng.com/c/8uzjSxsxxNR

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。