游乐游手机版
首页/AI热点日报/热点详情

云天励飞发布未来算力蓝图:三款AI推理芯片及超节点异构集群

类型:热点整理2026-07-19
云天励飞公布三款AI推理芯片DeepVerse100P、100D、100L,分别针对Prefill、Decode及DecodeFFN环节优化,通过万卡异构集群协同部署提升系统效率,降低Token生成成本。同时推出IFWA软件栈降低适配门槛,联合发起“1001计划”推动产业链协同优化。

7月18日,2026世界人工智能大会(WAIC)上,云天励飞正式公布了其未来两年多的AI推理芯片路线图。此次发布的DeepVerse100P、DeepVerse100D与DeepVerse100L三款芯片,分别针对AI推理过程中的Prefill、Decode以及Decode FFN三个关键环节的负载特征,进行了深度专用优化。简单来说,就是将复杂的推理流程进行解耦,让最合适的芯片处理最擅长的任务,从而实现算力与负载的精准匹配。

这三款芯片并非各自独立,而是面向万卡规模的异构集群进行协同设计与部署。通过对推理不同阶段的解耦,为每种计算负载匹配更精准的算力资源,其核心目标是提升AI推理系统的整体效率,并持续降低Token生成成本。

推理负载持续分化,算力优化走向精细化

如果深入观察当前大模型推理的负载特征,不难发现一个明显趋势:应用场景正在快速分化。通用AI助手(如智能对话、知识问答)、深度推理应用(如复杂逻辑推理、编程辅助),以及实时智能体系统(如Agentic Coding、多Agent协同),它们的计算负载特征存在显著差异。

随着AI应用不断深入,单次任务的上下文长度、推理链路的复杂度以及实时交互的要求都在持续攀升。这对推理系统的吞吐量、延迟和综合成本提出了更高要求。对于大规模AI推理部署而言,峰值算力已经很难单独反映系统效率,计算、访存、互联和系统调度等多重因素,共同决定了Token生成的效率与成本。

大模型推理不同阶段的计算特征差异同样明显。Prefill阶段需要集中处理输入上下文,对计算能力要求较高;Decode阶段则是逐Token生成,对内存带宽和数据访问效率更为敏感。随着MoE等新型模型架构的发展,Decode阶段内部的Attention与FFN在计算、访存等方面也呈现出不同的资源需求。

针对这些变化,云天励飞计划推出三款云端大算力推理芯片,其设计思路非常清晰:

DeepVerse100P瞄准百万级上下文的Prefill场景。在传统混部架构中,长上下文Prefill与Decode共享算力与带宽资源,容易引发资源抢占,影响Decode生成吞吐。专用芯片则能有效避免这种干扰。

DeepVerse100D面向Decode环节打造专用推理引擎,其内存带宽达到主流芯片的数倍,并支持1024卡Scale-up及光互联系统架构。通过按需建立光路直连,并根据任务动态重构光路,减少传统多跳电交换和静态组网中的排队、拥塞及中间转发开销,从而降低多节点通信阻塞和尾延迟,显著提升逐Token输出的稳定性。

DeepVerse100L则针对Decode阶段计算密集型的FFN环节,采用3D Memory架构,相比主流HBM大幅提升了内存带宽。通过低延迟芯片互联和激活数据快速传输,提高了计算与通信的并行效率。

三款芯片协同面向万卡异构集群

当AI推理进入规模化部署阶段后,芯片优化思路已经从单颗性能提升,走向多芯协同和集群级效率优化。

在万卡规模的推理集群中,系统效率并非单卡性能的简单叠加。不同推理负载对计算、内存和通信资源的需求差异巨大。当Prefill与Decode、Attention与FFN共享同一套通用算力资源时,资源竞争几乎不可避免。集群规模越大,通信阻塞、资源等待和尾延迟等问题就越突出,最终影响整体推理效率。

因此,要提高Token生成效率,除了优化单颗芯片性能,更需要围绕芯片在集群中的协同,对推理过程中的计算、访存、互联和资源配置进行系统级设计。

基于DeepVerse100P、DeepVerse100D和DeepVerse100L,云天励飞计划推动三款芯片在万卡异构集群中实现分离式部署与协同运行。按照Prefill、Decode和Decode FFN的不同负载特征,分别配置相应芯片和资源池,通过高速互联形成协同运行的异构算力系统。

该方案围绕Token生成全过程进行系统优化。通过对不同推理阶段进行分离,降低不同负载之间的资源干扰,并根据实际需求灵活配置计算、访存和通信资源,从而提升集群资源利用率和整体推理效率。

从面向特定推理负载进行芯片优化,到不同芯片之间的协同,再到万卡级集群应用,云天励飞正在将AI推理芯片的优化范围从单颗性能延伸至集群级效率。面向“百亿Token一分钱”的长期目标,他们希望以三款芯片为核心,构建一套服务于大规模Token生成的“推理工厂”,通过芯片、互联、软件和系统的协同优化,提高算力产出效率,持续降低单位Token成本。

IFWA软件栈:降低国产算力应用门槛

硬件异构程度和集群规模不断提升,对软件栈的要求也水涨船高。模型能否快速完成适配、算子性能能否充分释放、不同硬件资源能否高效协同,这些因素直接影响DeepVerse芯片在大规模集群中的实际运行效率。

围绕DeepVerse芯片及其集群应用,云天励飞持续建设IFWA软件栈,其覆盖AI模型开发、编程及系统等不同层级,为模型适配、算子优化、编译部署和软硬件协同提供全面的软件支撑。

在兼容性方面,IFWA围绕Transformer主流架构,持续完善PyTorch ATen算子的适配和性能优化,并加强对vLLM、SGLang等主流推理框架的支持。通过兼容主流软件接口、复用成熟开源组件,有效降低了模型向DeepVerse平台迁移和部署的成本。

在模型适配和开发效率方面,IFWA构建了覆盖模型量化、压缩、编译和部署的一站式自动化工具链,并引入AI Agent参与推理芯片适配和性能优化。此前,云天励飞已开源Houmao多Agent异构编程框架,由不同Agent协同完成模型开发、算子开发、性能优化和测试验证等任务,将部分依赖人工经验的芯片软件开发流程转化为自动执行、自动验证和持续优化,从而缩短新模型和新算子的适配周期。

同时,云天励飞还将成熟的Triton算子能力融入FlagOS,通过代码贡献、联合验证和社区复用,推动相关能力在国产AI软件生态中进一步共享,减少不同硬件平台在算子适配上的重复投入。

在云天励飞的规划中,IFWA并非一套封闭的软件体系,而是通过对主流模型、框架和开发工具的兼容,降低开发者的迁移和使用成本,缩短模型在DeepVerse平台上的部署周期,让国产算力更加便捷地进入实际应用场景。

“1001计划”,推动Token成本协同优化

降低Token生成成本,说到底是一项系统工程。

从芯片架构、IP与EDA,到封装测试、系统互联、软件栈和算力平台,再到模型及应用,产业链每个环节的效率都会影响最终的Token生成成本。要实现极致性价比的Token,需要产业链上下游共同参与和协同。

今年5月,云天励飞联合30余家单位,共同签署了“1001计划”倡议。该计划围绕Token生成效率和成本,推动产业链上下游加强协同。通过更紧密的产业合作,使模型和应用需求更早反馈至芯片及系统设计环节,推动成熟软件能力加快复用,同时加速芯片在集群和实际场景中的验证与应用。

随着AI走向规模化应用,算力竞争正在进一步转向对系统效率和单位Token成本的持续优化。芯片、软件、系统和应用之间的协同程度,也将越来越直接地影响AI算力的实际价值。以“百亿Token一分钱”为长期目标,云天励飞将持续推进芯片、系统、软件和产业生态的协同创新,与更多生态伙伴共同提高Token性价比,推动国产AI算力从“能用”迈向“好用、易用、用得起”,为人工智能规模化应用提供更加高效、普惠的算力基础。

来源:https://m.elecfans.com/article/8120937.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。