7月的上海,世博展览馆周围,高温与阵雨都没能拦住观众的热情。大会主办方两次发信息提醒:人流集中,排队入场耗时较长。展馆内,AI与机器人行业的从业者、投资人、创业者,甚至求职者,在四天时间里被高密度“压缩”在一起。有人拉着行李箱,站在熙熙攘攘的人群旁,用一台老旧的笔记本电脑亮出标语——“寻找一起创业的小伙伴”。
过去一年里,从Claude崛起,到龙虾OpenClaw“破圈”,市场已经被充分教育。智能体这个概念,不再陌生。而伴随智能体而来的热词,是因为它“烧钱”才被广泛关注的Token——也就是AI大模型处理文本的最小单位。这一年,是AI大模型转向智能体、切实代替人类工作的一年,也是Token消耗暴增的一年。这给参展的企业和机构带来了哪些影响?
这篇观察,主要围绕AI与智能体、算力展开。

7月18日,世博展览馆H1展厅门外拥挤的人群。
聊参数的人少了,能不能干活才是关键
走进WAIC展馆,一个直观的变化是:在以AI大模型为主题的H1展厅里,很少有展商再拿“我们的模型有多少参数”当卖点。取而代之的问题更务实——AI Agent能不能在具体场景中,真正代替人类把活儿干了?
展会上出现了不少外国面孔。百度展台上,一位来自巴基斯坦、在中国求学14年的外贸公司经理阿里告诉记者,他印象最深的是“有用”。“中国的AI和机器人不是摆在那里好看,而是真的能帮人类。一楼展厅里,比如百度搭子,我有些工作没在电脑上完成,在手机上告诉它要做什么,它就能给你处理得很清楚。二楼展厅的机器狗,有些人过不去的地方,它就能过去。”
展台工作人员进一步解释:“那些看起来不大,但在真实工作里高频、琐碎、耗时的任务,最适合智能体接手。所以在应用中,百度搭子覆盖的场景不只是做PPT这种标准化办公任务,还包括工作流里大量细小但真实的环节,比如检查开会材料里哪些链接无法访问。”
到了B端,智能体要真正进入企业的工作流,远比在展台演示复杂。容联云产研中心副总经理唐兴才对记者坦言,他早先认为智能体应该去适应企业内部的固有流程,但推进过程中发现,人需要适应智能体的工作方式,才能发挥最大效率。
容联云从四年前就开始探索AI客服落地。“之前,座席需要自己思考、关注客户说了什么。现在用户进线时,智能体可以洞察,甚至给出回答建议。过去,座席大量背话术是很重要的工作,这其实就是背企业的知识库。现在智能体把企业知识库和所有信息都掌握了,座席的作用更偏向于审核——看看智能体给出的建议合不合适,然后确认使用。座席变得更像小模型时代的训练师,确认审核这个动作,正在调教模型变得越来越聪明。”
那么,同样一个工作,用智能体和用人工,成本到底差多少?
唐兴才给出了明确答案:人工座席每天工作8小时,需要培训,还面临流失风险,每天接听150到300通电话就已经饱和,成本大约在5000到8000元。而智能体可以24小时工作,每天处理话务量1万以上,服务标准统一,没有情绪问题和个人差异化,成本大约2000到3000元。能力上,智能体达不到优秀人员的水平,但可以达到合格水平。“这使得它的边际成本非常低。”
AI智能体的“落地”与“实用性”,在H4展馆体现得更充分。这个区域里,70%的企业成立不足3年,很多是“AI原生”企业,从成立起就以AI能力为核心。正因如此,它们更看重AI实际解决问题的能力,是科研成果转化的最佳实践者,对成本和落地也更加敏感。
一个典型的例子来自百型智能。记者走到这家公司的展位前,发现创始人韩美正和几位看上去很年轻的公司员工自拍。韩美此前在阿里巴巴做出海业务,有20多年的B2B跨境经验,而公司主力AI研发人员之前研究的领域是“图论”。行业经验与技术结合后,百型智能在2024年已经成为国内最早做单智能体Agent的公司之一,拥有中国首个备案的外贸垂类大模型,在“用AI帮助国内企业出海找客户”这个痛点上实现了落地。

百型智能创始人韩美。
韩美对记者直言,公司的现金流一直很稳定,客户多为中小企业。“我们选择做难而正确的事,对中小企业收费不太贵,按结果收费。目前我们的智能体已经服务了1000多家企业出海。新推出的企业本体OntoZ,让群智能体覆盖客户更多Lead2Cash工作流,同时成为数据入口,主动沉淀数据资产,实现高频反馈下的交付自优化。”当被问及服务的企业里哪个行业出海最多时,韩美坦言机器人、3C数码等中国产品最受海外欢迎,“带电带智能带软件的出海势头最好。”
客户从人转向智能体,如何节省Token?
智能体的流行,也让Token消耗量剧增。这一趋势从年初的龙虾OpenClaw热潮开始被业界重视,之后几乎成了行业共识。
当你确定Token消耗将巨量增加时,如何才能抓住这个机遇?WAIC现场,多家芯片以及AI基础设施厂商给出了答案,而且解决方案“八仙过海,各显神通”。
在H2算力主题展区,记者看到了多家芯片公司展示的黑色集装箱一般的巨型机柜。不少算力厂商推出了卡数各异的“超节点”产品。

WAIC展馆内展示的磐久AL128超节点服务器。
壁仞科技AI框架架构副总裁丁云帆告诉记者,当前AI发展面临三大核心挑战:模型参数从千亿迈向数万亿(超大参数),Agent等应用场景要求百万级上下文长度(超长文本),推理和训练都需要成千上万张GPU协同工作(超大集群)。仅凭单张GPU的算力性能,已经难以独立承载这些复杂任务。如何实现海量GPU高效协同,使之如同一台一体化超级计算机,正是超节点架构着力破解的核心难题。
不过,当前主流的电互连超节点方案正面临规模扩展的物理极限。随着GPU算力持续增长,互连带宽需求将超过1TB/s,端口速率将达224Gbps,而铜缆电信号在3米内就会严重衰减。光互连成为突破这一瓶颈的必然选择。因此,壁仞科技在WAIC期间推出了下一代NPO光互连、分布式解耦架构超节点方案。
“异构”也是关键词之一。
从“AI四小龙”时代走来、在上海“主场作战”的商汤,此次带来了商汤大装置实现多项关键技术突破的消息。比如依托异构混合推理,商汤大装置实现主流国产芯片MFU提升85%到152%,整体推理性价比达到英伟达H系列的1.25倍。商汤科技董事长兼CEO徐立表示,谁能以更低的成本、更高的效率、更稳定的供给,来提供高质量的Token资源,谁就能推动AI时代的新繁荣。

无问芯穹联合创始人兼CEO夏立雪发表演讲。
无问芯穹联合创始人兼CEO夏立雪在WAIC现场披露了公司首创的跨集群异构PD分离架构。他认为“计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。”他解释称,智能体推理上下文极长,交互轮次极多,缓存命中率极高,对吞吐、时延、缓存复用的要求远高于传统对话场景。不同芯片在预填充和解码两个阶段,性能表现差异很大。而目前各地已有的存量算力集群基本都是同构设计,普遍各有侧重、存在“偏科”。新架构可以让“偏科”的硬件只刷自己最擅长的题,极大提升大模型推理系统效率。
相比架构改变,PPIO创始人姚欣更强调客户的变化。他认为“智能体时代最重要的变化,就是云的第一客户从人变成了智能体”。基于此,他在WAIC上宣布打造“面向智能体时代”的Token智能工厂,以及打造“智能体为第一客户”的Agentic Cloud。前者旨在帮助企业避免Token浪费,后者则是为智能体打造的云服务体系。
在Token生产商眼中,智能体已经逐步取代人类,成为Token的“第一大用户”。这带来了商业上的改变,对AI基础设施提出了更高要求,也给国产算力发展创造了全新的机遇。
可以预见,随着智能体应用进一步普及,Token的供需与效率还将持续重塑算力产业的格局。而所有技术迭代的最终指向,都是让AI以更低的成本、更稳的姿态,真正成为千行百业的生产工具。这趟由技术驱动的产业列车,刚刚驶入最具想象力的区段。
