计算需求正以指数级速度增长,这已不再是新鲜话题。然而,当前仅依赖产能的线性增长来堆叠算力,供需之间的缺口恐怕只会持续扩大。
2026年世界人工智能大会上,无问芯穹联合创始人兼CEO夏立雪指出,从预训练到后训练、从推理时扩展到智能体扩展,四条规则定律正在同时发力,模型训练与推理的“超级市场”正在相互孕育、彼此成就。

当前AI基础设施的核心任务十分明确:必须以极致效率,服务更大规模的智能需求。
围绕规模与效率这两大核心锚点,夏立雪从无问芯穹的AI生产力公式出发,首次公布了Agentic Infra的“前店后厂一中心”战略布局。该布局涵盖三大核心技术能力与产品服务体系——“算力集散中心”:Agentic Infra自主式基础设施平台;“Token工厂”:Agentic MaaS大模型服务平台;“AI生产力商店”:Agentic Infra行业解决方案。

这套Agentic Infra产品与服务体系立足基础设施,向下汇聚能源与芯片,向上支撑模型与应用,不仅极致提升了底层资源向AI生产力转化的规模与效率,更具备了Agentic AI时代最显著的AI原生能力——通过基础设施智能体蜂群,赋能资源规模扩展、提效Token生产,并支持Agentic AI的持续进化。

赋能下一代Agentic AI在线进化
无问芯穹Agentic Infra自主式基础设施平台的核心目标是实现智能资源规模最大化。它如同一个“算力集散中心”,将散落、异构的算力资源统一汇聚、弹性调度、按需分发,为模型与应用层筑牢充足、稳定、可扩展的算力底座。
夏立雪认为:“算力的异质化与碎片化并非某个地区独有的问题,而是全球性挑战。如何将不同区域、不同形态的算力资源高效聚合与协同,才是扩大智能资源规模的关键。”

无问芯穹自成立以来,一直致力于通过“多元异构、软硬协同”技术破解异质算力聚合难题。他们打造的面向异构集群的大模型跨域训练系统,已集成于Agentic Infra平台软件中,通过计算通信重叠的流水编排、自适应通信流调度和异构算力调度机制,三位一体全栈协同优化,能够系统性地解决这一行业难题。
该系统已通过三大类跨域算力聚合训练实践的生产级考验——
第一个案例:超远距离聚合。无问芯穹联合中国电信,完成了国内首例超4000公里的大模型跨域混训,新疆哈密与广东深圳两地集群联合训练性能提升165%,充分验证了超远距离跨域集群协同训练的可行性。
第二个案例:多数据中心聚合。打通4个不同代际、不同型号的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升41%,有效盘活了不同批次的存量异构算力。
第三个案例:混合云算力聚合。实现本地私有集群与公有云算力的安全互通混训,整体性能提升68%,帮助众多企业客户解决本地算力不足、云上资源闲置的错配痛点。

目前,这套跨域训练系统已在全国部署,触达超37000P算力,覆盖16种主流芯片,盘活了广域分散的异质算力,成为Agentic AI时代最坚实的底座。
夏立雪表示,随着大规模跨集群强化学习训练技术的持续成熟与突破,无问芯穹还将继续深耕并行策略、通信融合、智能算子、极致容错等核心技术。未来,跨域计算资源的支撑规模将拓展至十万卡级以上,支撑下一代Agentic AI的在线进化。

Token工厂:以效率驱动规模增长
Token经济时代,无问芯穹在2024年初便提前布局的Agentic MaaS大模型服务平台,正迎来高速且持续的增长曲线。这个平台犹如一座“Token工厂”,其核心目标是用极致效率服务Token的规模化、高质量生产。
夏立雪通过千卡到万卡规模的完整推理服务技术栈,展示了Token工厂内部的优化空间。从网关、路由到底层推理实例,Token工厂层层可优化、处处有增量。

随后,夏立雪披露了无问芯穹首创的新一代推理系统优化成果——跨集群异构PD分离架构,简称PDD。
智能体推理需求的特征可概括为“三极”:上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求远高于传统对话场景。同时,从实测数据来看,不同芯片在Prefill和Decode阶段的性能差异极大。而眼下,这些散落在不同地区的存量集群几乎都是同构的,且每个集群都有点“偏科”。
因此,PDD架构首先利用高性价比的广域网以太网,将分布在各地的已有同构数据中心连接起来,让算力强的集群执行Prefill任务,让显存带宽高的集群执行Decode任务。这就好比让“偏科”的硬件只刷自己最擅长的题目,极大提升了大模型推理系统的效率,堪称每座Token工厂都必备的“超级管线”。
PDD将传统的PD分离链路创新解构为“P-RLD-MD”的三级分离式推理架构,相当于为这条“超级管线”加装了一个“精密增压阀”。对于高传输延迟的请求,RelayDecode先行输出Token给用户,让用户侧完全感受不到长达数十秒的传输延迟;当传输完成后,任务被无缝切换给MainDecode处理,避免RelayDecode被长期占用。通过这一设计,仅需极少量机器承担RelayDecode,即可掩盖以太网KV Cache传输延迟。
实测数据显示,该架构在实现首Token延迟降低51.5%的同时,单Token成本可降低37.5%。这不仅意味着用户侧速度体验的显著提升,更意味着每个集群都能被充分利用,最大化释放全域异构算力的产业应用价值。

过去一年里,无问芯穹的Token工厂通过一系列原始技术创新,推动了推理成本下降10倍。夏立雪判断,随着跨集群异构PD分离架构的规模化落地,推理成本还有10倍的下降空间。
无问芯穹已携手上海移动,联合打造了“沪芯沪产服务沪客”的“天问”模型服务门户,并与AI原生新世代社区“观猹”联合打造了“中国版OpenRouter”——TokenDance平台。未来,无问芯穹将持续携手优秀行业伙伴,以这套高效的“Token工厂”赋能更多产业领域、服务更广泛用户。
(本文原题:《PDD,Token工厂必备的“超级管线”!“前店后厂一中心”布局来了!》)
