在今年世界人工智能大会(WAIC)期间,“世界模型”成为高频热词,但细听各方观点,不同参与者对这一概念的解读其实并不一致。

7月19日,上海西岸国际会展中心,同一场论坛上出现了两种截然不同的声音。中国科学院院士、南京大学副校长周志华指出,决策层世界模型仍面临现实困境:推演误差与交互试错成本高昂。他的团队虽取得一定进展,但这只是他口中“正在探索的方向”之一,远未达到可落地的阶段。
昆仑万维董事长兼CEO方汉则给出了更为激进的判断:“2026年是‘世界模型元年’。AI不再只是内容的生成者,而是开始理解世界运转规律,并能预判行动带来的后果。”
一方说“探索中”,一方喊“元年”。产业已开始抢跑,但世界模型的地基显然尚未夯实。
同一个世界模型,各家“解题”思路各异
每家公司对世界模型的界定,几乎都精准地落在自身业务上。
腾讯不做硬件本体,只承担具身大脑平台的角色。腾讯首席科学家张正友认为,机器人行业如同iOS与安卓、Mac与Windows,也将分化出“全栈自研”和“平台+生态”两条路径,腾讯选择后者。在模型层面,他指出VLA(视觉语言动作模型)短板明显——缺乏预测能力,而世界模型可以基于行动后果进行预测。世界模型的下一个有价值方向,在于模型能同时传递语言和图像信息,具备推理与想象力。
智象未来创始人兼CEO梅涛认为,真正的世界模型需具备三大要素:表达、推演、构造世界。实现这些的关键在于让模型建立对物理世界的统一认知。这正是智象未来坚持原生全模态大模型的初衷——不是做更大的拼接模型,而是在底层将“世界的运行规律”刻入模型DNA,以统一方式理解视觉、语言、动作和空间关系。梅涛指出,若仅仅复现世界,本质上只是在做现有知识的压缩、拟合与复刻。在此范式下,人类五千年文明积累的信息量上限,就是AI的能力上限。但他也坦言,当前包括视频、多模态、具身、3D在内的各类世界模型,距离真正的世界模型仍十分遥远。
生数科技同样基于视频数据训练世界模型,强调对物理世界的理解。CEO骆怡航认为,世界模型必须同时具备感知理解、预测想象、行动三个维度:“世界模型一定要刻画整个人与世界的交互规律,同时能驱动人与数字、物理世界打交道,这个定义应具备很强的Foundation(基础)属性。”
作为PhysX物理引擎奠基人之一的张立华,其判断标准则落在是否符合物理规律上。他认为,现有主流世界模型基本仍是数据驱动的视觉模型,难以将物理规律准确嵌入其中。“虽然你看了大量图像、视频等数据,形成了某种物理直觉能力,但这种能力存在局限,就像人的物理直觉一样,虽然能在某些条件下给出相对准确的趋势判断,但无法保证所有情况下的准确性和真实性。看多了并不等于抓住了表象背后的物理机制。”
世界模型定义虽存争议,但并不妨碍各大公司卡位。昆仑万维不再局限于视频(SkyReels)、音乐(Mureka)等AI生成内容业务线,开始向世界模型、机器人模型等物理AI叙事框架转型。生数科技不瞄准单一场景,而是致力于打造通用能力,用同一个模型驱动不同本体执行不同任务,半天到一天内即可完成适配部署。飞捷科思则发起“物理智能创新联合体”,联合32家单位,定位为国产世界模型的操作系统底座。
谁能率先抓住“世界模型”这顶帽子,谁就占住了故事的入口。一位投资人不无感慨地透露,他年初见过一家具身智能公司,能讲出非常好的应用场景,时隔三个月后便开始讲述世界模型的故事,“这是很现实的问题”。
模型存在短板,尚不能完全信任
世界模型对物理世界的理解仍有欠缺。
破壳机器人创始人许华哲提到,即便当前模型已能做到不错的像素级预测,也不能完全信任它。“只要是模型生成出来的东西,就一定带有模型自身的特性。如果在这样的仿真器里学习策略,很容易拟合到模型特性,而非真实世界特性。”
要填补这个缺口,模型需要两个方向:一是让模型本身更懂物理规律,二是让模型学习的环境足够真实。
前一个方向,是视频生成厂商正在做的事情——赌底层算法架构和高质量数据实现跃升后,模型能自己将物理规律“悟”出来。智象未来选择视频、全模态到世界模型这条路径,因为“互联网视频数据非常多,这些数据已包含许多物理规律和因果关系”。他们自研了UiT(Unified Transformer)架构,数据端则涵盖20万小时版权数据,覆盖超70%华语电影资源的行业多模态语料库。生数科技则采用MoT架构(一种稀疏、多模态Transformer架构),将理解、生成和行动整合在一起,而非“先理解、再规划、再动作”的分步路线。
模型“悟”出规律后,还需放入仿真环境训练和验证。如果仿真环境本身的物理规律不够真实,模型学到的内容再像,也经不起真机检验。这正是飞捷科思正在做的事——为模型提供可信的训练地基。
一切源于张立华团队的踩坑经历。他的复旦实验室团队早年曾使用其他商用具身仿真平台进行仿真训练,“仿真时机器人表现得非常完美,但把实机造出来后,一验证就发现不行”。后来团队排查发现,底层物理引擎的动量并不守恒,仿真训练了很久,但因模拟的物理规律不符合现实世界规律,导致训练好的算法无法在真机上复现。
经历了这个教训,团队没有急于扩大模型训练,而是转向自研底层物理引擎和仿真训练平台,目标就是提升物理引擎和仿真训练平台的精度与能力。更进一步,他们做出了全新一代物理世界模型Fysiverse,其架构为创新的“显式物理模拟器+生成式渲染器”双驱动,让生成模型继续发挥视觉表达优势,用物理引擎弥补因果建模的短板。
张立华认为,当前绝大部分模型仍以端到端为主,很少体现推理能力,但一个真正通用、有泛化性的模型,未来必须具备推理能力。“遇到物体位置突然变化这类情况,机器人应该能像人一样及时做出判断并调整策略,而不是仅靠预训练学到的反应去执行。”而这种推理能力的训练,同样需要物理真实的仿真环境来支撑。
第一人称视角数据缺失,各家的补法不尽相同
模型要学好,除了需要正确的架构和环境,还需要足够多的数据。具身智能下一步需要大量第一人称视角的操作数据,即以人的视角拍摄的、真实操作物体时的视频。
视频生成厂商正将自身生成能力延伸到模型训练的数据供给上。这背后是世界模型对高质量数据的渴求。梅涛提到,目前容易获取的数据基本已被拿得差不多,但真正高质量、有私域价值的数据反而越来越难获取。
梅涛谈到了智象未来与一家机器人公司的合作:对方提供人类带着夹爪操作的仿真数据,每个关节点精度约在毫米级;智象未来则生成一份不带夹爪的真人第一人称实操视频,与原始数据一一对齐。“用这样的视频可以做增广,一份高精度、带夹爪的视频,能生成出上百到上千份不同背景、肤色、形态的版本,同时保持高精度。”
C端的数据采集目前仍停留在比较原始的阶段。许华哲提到,现在主要是靠58同城、猎聘这类公司,派人带着采集设备上门拍摄;下一步可能是将采集设备直接寄到普通人家里,让人边带娃或边做自媒体,边采集数据赚点钱。
究竟需要多少量级的数据,行业仍在探索。启明创投给出一个参照:头部机器人公司的有效数据,将从2025年的“万小时级”跃升至2027年的“百万小时级”,其中人类第一视角数据将占绝对主导。
而数据恰恰是行业难以共享的东西。许华哲提到,数据是具身智能中最核心的资产,几乎没人会真正将其开源,网上很多号称开源一万小时的数据集,点开可能只有五十小时。
当行业有人喊出“元年”时,学界在解理论“死结”,厂商在用同一个词争不同的定义。模型在向前奔跑,地基在向下深挖,中间还缺数据。世界模型在尚未被讲清楚之前,就已经被相信了。
