7月20日下午,在2026WAIC“清华朋友圈之夜”论坛上,曦望Sunrise董事长徐冰发表了一场题为《与Agent共生,与同路人共造——Agent时代的推理基础设施与创业地图》的演讲。这场演讲中,有几个核心观点值得深入思考。
徐冰首先抛出一个判断:顶尖智能在很长一段时间里都是稀缺资源,它依赖高校多年培养专业人才,就像奢侈品一样,高端且昂贵。但今天,局面已经发生根本性转变——顶级智能第一次成为可按需采购的标准化商品,智能正式转型为一种数字基础设施。换句话说,过去你想用上最顶尖的智力,必须依靠人类专家;现在,你直接购买Token即可获得。
“今年才是大众真正认可Token商业价值的元年。”徐冰说这话时,有数据支撑——当前市场已经大规模地为顶尖大模型付费,不少用户每个月在模型上的支出达到上千元,甚至频繁将Token额度耗尽。这可不是小打小闹,而是实实在在的需求信号。
演讲中,徐冰还分享了一个有趣的现象:“Token的主人正在换人。”他解释:过去三年,Token是人购买的、人阅读的。但从今年开始,越来越多的Token,人根本不会看一眼——那是Agent在规划、调用工具、写代码、自我检查时,机器为机器消耗的。一句话:Agent正在成为Token的真正消费者。
不过,徐冰特别强调了一个容易被忽略的关键点:“Agent数量超过人类只是表象,真正的经济拐点是Agent的工作小时数超过人类的工作小时数。”他进一步拆解:推理需求是由Agent数量、活跃时长、行动步骤、每步Token与验证重试倍数这五个变量连乘决定的,结果是指数叠加式的增长。更值得关注的是,Agent并不是在切分存量的蛋糕,而是在创造历史上不存在的增量市场——这背后隐藏的机遇,远比想象中庞大。
关于曦望的技术路线,徐冰也给出了清晰的解释。为什么押注大容量内存?他打了个比方:“在Agent系统里,内存容量不只是显卡的一个配置参数,它是数字员工的工位。工位越大,一台机器能够容纳的Agent越多,每个Agent记住的信息越久。”当然,他也承认,极高带宽场景与训练负载仍然更适合HBM,曦望要证明的是,在长上下文、高并发等容量敏感的Agent负载上,大容量内存加上全栈协同,能够实现更低的真实任务成本。这才是真正的竞争力所在。
最后,徐冰提到了一个行业趋势:云端AI正在从“野蛮生长”进入“高成本稳态”。全球云厂商已经投入数万亿美金的Capex建设AI数据中心,Token账单已经成为企业最需要关注的成本项。他算了一笔账:“如果推理成本能降低90%,很多历史上不赚钱的应用场景将转变为可盈利的商业模型,进而带动推理需求和算力需求的爆发性增长。”说到底,降低推理成本,才是打开下一波增长大门的钥匙。
