一组数据颇为引人注目:2026年上半年,无问芯穹的Token调用量在7个月内激增了40倍,其中超过95%的推理任务均源自智能体应用需求。

在2026年WAIC期间,无问芯穹CEO夏立雪与媒体交流了公司的最新发展。目前,他们已在全国范围内纳管16种不同架构的芯片,总计管理3.7万P算力资源。过去三年间,推理成本已降至原来的十分之一;他进一步判断,在未来的全链路协同优化下,成本仍有90%的下降空间。
夏立雪指出,当前AI行业的核心矛盾始终未变:需求呈现指数级增长,而芯片供给却呈线性增长,仅靠堆叠芯片已无法追赶需求的增速。他打了一个形象的比喻:大家并非觉得AI没用,而是觉得它“有点贵”——这恰恰是供不应求的信号。如果供大于求,人们只会觉得它毫无用处。
过去三年推理成本的下降,已带动了第一批AI应用场景的落地。他判断,未来全行业至少还有90%的成本下降空间,其来源并非仅限于单点技术优化,而是全链路协同效应:包括跨域异构集群的资源池化、PDD等新架构的普及,以及对场景端需求进行分层管理。
夏立雪认为,真正的生产力公式应当是“资源规模 × Token生产效率 × Token转化为生产力的效率”。目前,全行业正在共同构建价值衡量指标,其核心在于计量每个Token所产生的实际经济价值,推动行业从“按Token数量计费”向“按最终价值计费”转型。
据了解,今年上半年,无问芯穹的Token增量几乎全部来自Agent应用。“超过95%的推理任务都运行在智能体相关任务上,无论是直接服务大模型厂商,还是直接服务垂直行业客户,最终需求都源于Agent的落地部署。”夏立雪表示,目前代码生成、文娱营销、基础设施运维、具身智能、制造、电力、法律等行业,均已开始大规模使用AI技术。
针对行业普遍关注的Token标准化问题,夏立雪明确判断:Token必然走向分层,且这一分层进程已经发生。未来将出现面向高端复杂任务的高价值Token,也会有面向简单场景的高性价比Token。
这种分层趋势直接带动了过去一年国产芯片的落地进展。他坦言,国产芯片适配效果的显著提升,一半功劳来自技术端解决了跨集群调度、负载均衡等难题,但更核心的原因在于Agent带来了任务分层:智能体会衍生出大量不同复杂度的子任务,无需所有任务都运行在最高端的芯片上,国产芯片可以承担自己擅长的任务,不必再“硬扛”最复杂的大模型训练负载。
“不同芯片各有侧重,都能在价值金字塔里找到自己的位置,没必要浪费资源,杀鸡用牛刀。”
夏立雪透露,目前无问芯穹正在与行业客户探索多模型协同的分层交付模式,通过不同能力的模型配合完成任务,直接为最终结果负责。
对于今年的热点话题“物理AI”,无问芯穹宣布将具身智能场景纳入其Token工厂的覆盖范围。
夏立雪表示,AI必然从数字世界走向物理世界,云侧GPU、边缘节点、机器人本体的算力都应被纳入统一资源池进行调度。团队过去在大规模云侧强化学习、跨集群调度上积累的能力可以直接复用,其发布的RLinf新版本已实现真机渲染、训练到推理的全链路云边协同。Mizar-Robo推理优化方案已与星海图、云深处等具身机器人厂商达成合作,用于优化机器人端侧推理效率,形成“机器人采集物理世界数据—云侧强化学习训练—端侧推理落地”的完整闭环。“我们不做机器人本体,只做好具身场景的Token工厂,为合作伙伴提供低成本的‘弹药’,让他们能以更低的成本推广产品、拓展市场。”
谈到AI赛道的行业竞争,夏立雪认为,AGI并非单一公司能完成的使命。当前行业供需缺口仍在持续扩大,只要技术能创造效率价值,就存在商业空间。近期智谱GLM、月之暗面Kimi等清华系开源大模型登顶国际榜单,中国的开源生态是核心优势。开源让技术、数据、资源能够更快地流动并形成闭环,从而带动全行业效率提升。
当天,无问芯穹公布了Agentic Infra 的“前店后厂一中心”战略布局,涵盖三大核心技术能力与产品服务体系:“算力集散中心”——Agentic Infra 自主式基础设施平台;“Token工厂”——Agentic MaaS 大模型服务平台;“AI生产力商店”——Agentic Infra 行业解决方案。
