物理AI的“ChatGPT时刻”到底什么时候来?刚刚过去的2026WAIC上,世界模型成了绝对的主角,几乎所有讨论都绕不开它。
“2026年,可以看作是‘世界模型元年’。”昆仑万维董事长兼CEO方汉在大会上抛出这个判断,话里带着笃定。在他看来,2026年AI的核心命题不再是单纯的生成,而是转向“理解”与“交互”——让AI真正搞懂物理世界的运行规律,并且能跟现实环境进行闭环互动。
世界模型,被看作是让AI理解世界、在物理世界自主行动的关键技术底座之一。这次大会上,昆仑万维发布了Matrix-Game 3.5世界模型,蚂蚁灵波推出了具身原生世界动作模型LingBot-VA 2.0,智元、大晓机器人、极佳视界、它石智航、戴盟机器人等也都拿出了自家的世界模型方案。可以说,世界模型已经成为下一阶段AI竞争的兵家必争之地。尽管目前仍处于产业探索期,但随着具身智能落地的浪潮推进,世界模型正在站上舞台中央。
世界模型很“热”
从本届WAIC的阵容来看,中国企业世界模型的研发节奏明显加快了。
昆仑万维这次发布的Matrix-Game 3.5,聚焦的是可交互世界模型技术,创新性地实现了Patch级记忆注入——把图像或视频帧切割成带空间坐标的微小局部块,从而完成长期一致性的空间记忆。模型还构建了自动化数据生产管线,覆盖了1200多个游戏场景,为训练提供更多样本,并且核心架构已经宣布开源。

蚂蚁灵波则拿出了另一种思路:具身原生世界动作模型LingBot-VA 2.0。他们做出的选择是,让机器人的“大脑”不再依赖数字世界模型能力的“嫁接”,而是从动态建模、因果预测、实时执行这些与环境交互的原始需求出发,进行原生设计。这相当于在具身智能的发展路线上,划出了一条新的车道。
此外,极佳视界首次展示了“通用世界模型”全系列产品,覆盖从生成到行动、从本体到场景的完整链条;智元展出了世界模型GE-2,让机器人不仅能模拟环境,还能通过环境变化不断学习,为机器人迭代提供了闭环环境;大晓机器人发布了开悟世界模型3.1,走向融合生成智能、物理智能与认知智能的行动一体化世界模型。
与此同时,在解决“如何渲染世界”和“如何模拟世界”这个问题上,3D生成企业也在加速入局。影眸科技的世界生成模型Hyper3D WorldGen在WAIC上首次亮相,意味着3D生成开始从“单体”走向“场景级”,更多3D物品可以被直接用于仿真训练,实现了从真实影像到可训练场景的端到端转化。
世界模型这个“篮子”确实很大,各家技术路线不尽相同,在产业链中的位置也各有差异。尽管“世界模型元年”已经到来,但行业里还有很多共识尚待形成。不过,从这次大会可以明显看到,不同公司开始押注不同的技术路径或解决方案。
方汉的判断是:先Scaling,技术终究会走向收敛。在他看来,世界模型所有路径最后一定会收敛,就像自动驾驶曾经经历过多种技术路线角逐,最终收敛到端到端模型一样。但收敛需要时间,至少要做到1000万小时数据,模型能力才有可能出现质变拐点,多的话可能需要1亿小时。昆仑万维的方向之一,是利用异构数据来降低数据成本,方汉认为异构数据是未来世界模型或具身模型预训练的主要数据来源,“Scaling才是王道”。
它石智航创始人兼CEO陈亦伦则坦言,当前世界模型最大的挑战,不是生成“看起来真实”的世界,而是真正理解物理世界的运行规律。“仅依靠视频数据,无法学习完整的世界规律。”视觉能提供几何和语义信息,但无法直接获得力、接触等关键物理信息。对于需要操作和交互的机器人来说,触觉、力觉等多模态数据不可或缺。
总体来看,围绕世界模型的探索方向,正在呈现出多元化的趋势。
世界模型的下一站
方汉认为,游戏行业会率先被世界模型改变。随着世界模型的发展,开放世界游戏将不再依赖数百人团队数年的手工搭建,虚拟世界可以随着玩家行动实时生长、持续演化。未来三到五年,世界模型会成为游戏行业的基础设施,彻底刷新内容生产方式,而国产模型已经在这一赛道上领跑全球。
而在被认为是世界模型更长期、更具想象空间的应用方向——具身智能领域,行业仍在加速进化。
陈亦伦强调,世界模型的发展最终取决于高质量真实数据的持续积累。这类数据不仅需要包含完整模态,还需要同时记录机器人动作与环境状态的持续变化,本质上就是真实世界中“干活的数据”。
那么,世界模型的技术收敛会在什么时间点到来?方汉的回答很干脆:“谁先造出1000万小时的数据是关键。”目前行业模型训练普遍在10万小时数据量级,昆仑万维这次的发布花了20多万小时数据。谁会先实现?就要看谁先到达100万小时、500万小时、1000万小时,以及——到了1000万小时,到底能不能出现拐点。
“中国是所有数据采集设备的硬件产地,也就是说,世界模型的数据生产方面,中国在数据采集工具包括家政等服务场景上都有优势,我认为数据最大的产能地是中国。”方汉认为,在世界模型引领具身智能认识世界方面,中国厂商存在着明显的优势。他预测,今年底有厂商能到百万小时,明年底可能有厂商到千万小时,亿小时级别则需要至少3到5年。
机器人正在加速进入物理世界、加速“能干活”的趋势中。AI进入物理世界,必然要解决理解世界、知道如何行动的问题,世界模型也因此被认为可能成为具身智能的重要基础能力。但一个现实是,在模型路线上,物理AI的终局到底是端到端VLA(视觉语言动作模型)、世界模型、世界动作模型,还是更复杂的Agent系统,行业仍存在争议,很多厂商也在同时押注多条路线。
伴随着世界模型的热潮,具身智能的“ChatGPT时刻”还需要多久才能到来?WAIC上,多位行业人士给出了预判,时间从两年到五年不等。但行业里逐渐形成的一个共识是:物理AI的智能涌现,不会来自单一模型、单一数据源或单一路线,而取决于数据规模、模型架构、仿真评测、真机反馈、部署场景与硬件系统共同构成的持续进化飞轮。
