无问芯穹发布“前店后厂一中心”Agentic Infra战略,助力企业破解Token成本难题
在2026年世界人工智能大会(WAIC)上,无问芯穹创始人兼CEO夏立雪正式对外公布了公司全新的“前店后厂一中心”Agentic Infra战略布局。这一战略调整的背景是,越来越多企业客户正遭遇“Token刺客”现象——Token调用量持续攀升,但投入成本与业务产出之间的对应关系却愈发模糊,企业难以精准评估AI投入的实际回报。
无问芯穹成立于2023年,由清华大学电子工程系团队孵化,最初定位为连接M种模型与N种芯片的AI基础设施平台。公司从异构训练场景切入,逐步构建起面向大规模推理的基础设施能力。2024年底,随着推理需求爆发式增长以及Agent应用开始落地,无问芯穹明确了新的商业方向,将产业表达从“Token工厂”升级为“Agentic Infra”,以更贴合市场对智能体基础设施的需求。
“Agent并非一次性调用Token的‘套餐式’需求,而是需要将不同Token调用组织成一个完整、长期且与人协作的任务。”夏立雪指出,Agentic Infra的核心在于,基础设施不仅要服务于AI应用,其自身也要大量借助AI实现持续迭代与优化。
夏立雪将“前店后厂一中心”描述为一套聚焦规模与效率的AI生产力转化系统。无问芯穹保持中立立场,不直接参与模型或芯片的研发,而是作为连接模型、芯片与客户需求的独立平台。他将其类比为石化产业链中的“炼化厂”——负责将算力转化为“数字石油”即Token,并贴近行业客户,将真实需求反馈至整个系统,形成技术优化、服务提升与商业增长的闭环。
据无问芯穹方面介绍,过去一年公司通过一系列原始技术创新,实现了推理成本下降10倍,平台高可用率达到99.99%以上。目前,无问芯穹已与Kimi、智谱、MiniMax、阶跃星辰等头部大模型企业建立了合作关系。截至今年7月,无问大模型服务平台的单日Token调用量较2025年12月实现了40倍增长。
夏立雪判断,未来1至2年内,Token成本仍有超过10倍的下降空间。这一判断基于两个关键因素:一是模型结构逐步收敛,更激进的优化手段(如模型稀疏化、软硬件协同设计)将释放更大降本效果;二是算力供给持续增加,供需关系有望进一步改善,从而推动成本下行。
在WAIC大会上,无问芯穹发布了跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD),将传统的“PD分离”解构为“P-RLD-MD”三级分离式推理架构。实测数据显示,该架构在首Token延迟(TTFT)降低51.5%的同时,单Token成本可降低37.5%。公司正将该方案复用在更大规模、更多种异构芯片上,进一步拓展应用场景。
此外,无问芯穹还发布了面向大规模跨域强化学习训练的网络、平台、框架协同深度优化技术,实现了跨域强化学习训练连续一周零中断的稳定运行。未来,公司计划将跨域计算资源的支撑规模拓展至十万卡以上级别。
夏立雪表示,无问芯穹已开始布局以具身智能为代表的物理AI方向,但会控制投入节奏。他认为,具身智能的Scaling Law同样需要高效率、大规模的基础设施来支撑,而公司团队既理解数字AI也理解物理AI,具备相应的技术能力。
回顾公司发展历程,夏立雪认为,从=M×N到Token工厂,再到Agentic Infra,变化的是AI产业的演进阶段,不变的是“让每一块芯片在AI时代产生最大经济价值”这一核心目标。他也指出,传统云服务竞争的是规模效应,而AI Infra竞争的是规模与效率并重。
本文信息基于原始资料记录时的公开状态,企业业务、交易进度和市场数据可能持续变化,实际情况以相关企业及监管机构后续公开信息为准。
