AMD与Cerebras在Advancing AI 2026活动上正式宣布联手,共同开发AI推理解决方案。这一消息引发业界广泛关注——两家风格迥异的公司携手合作,究竟能带来怎样的突破?

根据官方新闻稿,该方案核心聚焦超低延迟AI推理场景。具体而言,它将AMD的Helios机架级解决方案与Cerebras的晶圆级引擎深度融合,目标明确——应对英伟达与Groq的联合竞争。
从双方披露的路线图来看,Helios机架扮演着“高性能、可扩展吞吐引擎”的角色,主要负责处理提示词和大上下文窗口。而Cerebras的Wafer-Scale Engine则专攻对内存带宽要求更高的Token生成与解码环节,强调超低时延表现。两个计算引擎协同工作,预计能将每瓦每秒的Token吞吐量提升5倍。这两套硬件的分工相当清晰。
为什么Cerebras的Wafer-Scale Engine在此环节能脱颖而出?原因在于它把数十万个计算核心和数十GB的SRAM集成在单块互连硅片上,几乎消除了外部网络瓶颈。数据在芯片内部流转,延迟自然大幅降低,这对超低延迟推理场景来说价值不言而喻。
