《科创板日报》8月22日讯 8月19日,A股正式迎来“人形机器人第一股”宇树科技。自2025年那场春晚起,全球用户已通过官方视频、社交媒体、企业年会表演乃至演唱会等多个场景,充分见识了宇树机器人出色的运动控制与动作表现能力。然而,在迈向具身智能终极形态的过程中,这顶“王冠”上仍缺少一颗关键宝石,那就是机器人的“大脑”——世界模型。

此次IPO,模型研发成为宇树科技最大的单一募投方向:42.02亿元募集资金中,20.22亿元投向智能机器人模型研发项目,11.10亿元用于机器人本体研发,其余资金则布局新型智能机器人产品开发及智能机器人制造基地建设。
上市次日,王兴兴在世界机器人大会(WRC)上回顾了宇树的模型研发历程——“早在2020年年初,我们便开启了基于视频生成的世界模型方向探索,只是当时成果并不理想,因此中途暂停了一段时间。”他表示,去年公司再次重新聚焦这一领域。“我们在AI模型方面的投入一直非常大,这无疑是公司当前资金和人力投入最多的方向。”
时间回到宇树上市前一天,工信部科技司副司长甘小斌在中国人工智能产业发展联盟第十八次全会致辞时指出,下一步将把握产业变革机遇,一体化推进技术创新、应用落地、生态培育与安全治理,其中包括以技术攻关为驱动,加快智能芯片等关键核心技术突破,探索类脑智能、世界模型、物理模型等前沿技术。
▌为何是世界模型?
在2026世界人工智能大会(WAIC2026)上,行业专家已经形成较为标准化的定义,用以区分“视觉生成模型”与“物理原生世界模型”。
真正面向物理世界的世界模型,作为AI的物理直觉引擎,核心能力并不在于生成或渲染画面,而在于预测动作发生后世界将呈现的真实状态,并遵循动力学、空间关系、力学约束、因果逻辑等客观规律。它通常具备四项关键能力:多模态融合感知能力、物理规律认知能力、因果长时序推理能力,以及闭环自迭代能力。
其完整的智能运行链路可概括为:看见环境→推演世界变化→预判自身动作后果→执行动作→采集真实反馈并更新模型。
在8月19日的宇树上市答谢午宴以及次日的2026世界机器人大会上,王兴兴在发言中都提到了宇树近期重点推进的一件事:物理AI机器人模型自进化。
具体而言,就是让AI模型自主编写机器人的控制代码,随后在仿真环境中进行训练和验证,再部署到真机中完成反馈分析。他表示,基础模型越强,自进化能力就越强;多源数据规模越大,自进化的规模效应就越明显;真机部署数量越多,数据积累与能力迭代也会越快,从而推动技能持续累加扩展,最终走向规模化技能生态。
这种“真机-数据-模型”的闭环机制,正是当前物理AI行业的重要技术趋势之一,也进一步解释了宇树科技为何将世界模型视为核心方向。
中信建投研报显示,物理AI正接棒成为下一阶段AI增长的核心变量。物理世界数据作为贯穿感知、决策到反馈的关键引擎,正面临巨大的刚性需求缺口。受制于保真度、规模化与成本之间的“不可能三角”,物理世界数据获取正在倒逼行业迎来三重变革:商业模式端通过社会化众包采数,技术范式端依托世界模型进行虚拟造数,资产属性端则跃升为企业高溢价的核心无形资产。
其中在技术环节,基于“种子数据为基、世界模型扩容、持续学习闭环”的战略路径,可打造“虚拟扩容与持续闭环”的造数引擎,打破物理时空限制,将商业侧采集到的种子数据实现指数级放大。
▌巨头混战
当然,世界模型早已不是一个全新概念,从全球科技巨头到顶尖AI科学家,早已纷纷涌入这条关键赛道。
例如,英伟达今年6月发布了“全能”世界模型Cosmos 3,被称为全球首个完全开源的全能模型。黄仁勋表示,“得益于多模态推理、语言、视觉和世界模型的突破,物理AI的爆发式增长指日可待”;谷歌此前发布的Genie 3,可实时生成交互式3D环境,除游戏应用外,还能为机器人和自动驾驶系统提供多样化训练场景。“AI教母”李飞飞以及Meta前首席AI科学家杨立昆各自创办的初创公司,也都将世界模型作为重点布局方向。
谷歌DeepMind首席执行官兼联合创始人Demis Hassabis去年末也曾直言,世界模型是他当时投入时间最多的领域,世界模型将是通往AGI的关键组成部分。
从当前阶段来看,世界模型仍处在相对早期的发展期,技术路线依然处于“群雄混战”状态。分析师按照技术定位,将各家的世界模型划分为三大类型:通用底座型、垂直专用型与跨域复用型。
通用底座型以能力输出为核心。其中,通用时空认知基座聚焦物理规律理解与因果推演,代表性模型包括英伟达Cosmos 3、Meta V-JEPA 2、Google Genie 3;场景仿真型底座则面向特定领域提供标准化仿真基础设施,代表性模型包括海外的Runway GWM-1、World Labs Marble,以及国内的腾讯HY-World 2.0、阿里HappyOyster等。
垂直专用型则聚焦单一场景,自动驾驶领域以Waabi Copilot4D、Wayve GAIA、蔚来NWM等为代表,具身智能领域则以1X World Model、流形空间WorldScape 0.2、高德ABot-PhysWorld等为代表。
跨域复用型作为产业新趋势,以特斯拉FSD World Simulator和小米MiMo-Embodied为代表,头部厂商率先构建横跨自动驾驶与具身智能的统一潜空间,实现技术能力与数据资产的跨场景协同。
世界模型为物理系统提供了两类关键能力:一是在行动前进行推演与风险预判,二是生成大规模合成训练数据,从而缓解真实世界数据采集成本高、风险大、效率低的问题。
国泰海通证券认为,虽然当前世界模型更多仍以技术和产业案例呈现,但其政策含义已经非常明确:谁掌握世界模型,谁就更有机会定义下一代机器人、自动驾驶与工业AI的训练方式。
分析师进一步指出,世界模型的竞争本质上是“下一代智能基础设施”定义权之争。AI竞争重心正从“大语言模型”逐步转向“物理AI”,而世界模型作为机器人与物理世界交互的“认知引擎”,已经成为全球产业政策与技术竞争的新焦点。
高质量数据集、仿真平台、训练算力以及真实场景验证都需要长期、持续且高强度投入,而且一旦形成平台化能力,往往会产生显著的生态锁定效应。因此,世界模型的发展不太可能完全依赖碎片化创业公司自发演进,最终大概率会向国家主权AI框架、头部科技平台以及具备场景优势的大型企业加速集中。
