2026年WAIC现场,世博展览馆H3馆的通道比往年更显拥挤。入口处,宇树的载人变形机甲GD01吸引众多观众排队进入驾驶舱拍照;300多台机器人真机散布在200多家具身智能企业展台之间;视频生成公司的展台与机器人公司相邻,屏幕上循环播放着机械臂倒水、无人机穿越丛林、虚拟角色转身的演示片段。不同公司的讲解员讲述着高度一致的内容:都在聚焦具身智能,都在探讨世界模型。穿梭于展台间的投资人,面对同一个问题——模型的实际水平如何——却得到指向不同维度的答案:有人展示VBench排名,有人调出RoboTwin 2.0的任务成功率曲线,有人谈及仿真到真机的迁移数据。同一个术语,在不同展台被不同的数字所定义。当具身智能与世界模型成为热门话题,榜单便不再仅是技术社区的内部排名,而是行业理解技术路线的关键入口,在某种程度上,更成为话语权的象征。
一张拼图,三个榜单
自2026年以来,具身智能与世界模型几乎成为AI领域最受关注的焦点。技术圈在探讨视频模型能否成为机器理解物理世界的路径;资本圈在思考下一代AI公司能否从“会说话的模型”进化为“会理解、会预测、会行动的模型”;媒体圈的问题则更为直接:当“世界模型公司”越来越多,究竟该如何评判孰优孰劣?然而时至今日,世界模型依然缺乏统一的定义和衡量标准。它更像一幅尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测——每一项能力背后都对应着一张榜单和一群支持者。拆解这幅拼图,有三块核心版图绕不开:一张回答“像不像”,一张回答“懂不懂”,一张回答“动不动得了”。理解它们,比看懂任何一场发布会都更接近行业的真实进展。
VBench:回答“像不像”
VBench是目前视频生成领域最常用的评测体系之一,由南洋理工大学S-Lab、上海人工智能实验室OpenGVLab等机构推出。它从主体一致性、背景一致性、运动流畅度、美学质量等16个维度对生成视频进行评价。它回答的问题非常直接:模型生成的视频,是否像真实世界,是否符合用户输入。在VBench 1.0认证榜中,头部模型得分集中在84分到88分之间,差距已经非常微小。因此,VBench在2025年推出了2.0版本,将评测范围扩展到人类保真度、物理规律、可控性、常识等维度,开始关注那些决定真实感、却容易被忽视的问题。根据其HuggingFace官方榜单的认证视图,主要排名如下:

图:VBench-2.0榜单:Veo 3以66.72%居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026年7月截图)
但VBench主要仍是对视频结果进行评价。画面可以很逼真,但模型却未必理解画面背后的规律。
WorldModelBench:回答“懂不懂”
如果视频生成模型被称为“世界模型”,那么它就需要接受更为严格的检验。2025年,来自UC Berkeley、UC San Diego、NVIDIA和MIT的研究者推出了WorldModelBench,将模型置于物理和常识环境中进行测试。该评测覆盖机器人、驾驶、工业、人类活动等7大领域,包含350条提示词和6.7万条人工标注,从指令遵循、物理规律、常识三个维度进行打分。其中,物理规律遵循占总分的一半。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中会如何变化。结果显示,即使表现最好的模型,也只有61%的视频正确完成了指令;12%的视频违反了质量守恒,11%出现了物体互相穿透的情况。模型能够生成一个看似合理的世界,但距离真正理解世界,还有明显的差距。

图:WorldModelBench官网榜单(来源:worldmodelbench-team.github.io,2026年7月截图)
RoboTwin 2.0:回答“动不动得了”
世界模型最终要服务于行动,沿着拼图向下游探索,机器人能否执行实际任务便成为一个非常重要的维度。RoboTwin 2.0由上海交大ScaleLab与港大MMLab主导,上海人工智能实验室参与。它包含50个双臂协同操作任务,涵盖抓取交接、工具使用、可形变物体操作,运行在SAPIEN仿真器上,支持Aloha-AgileX、ARX-X5、Piper、Franka、UR5共5种双臂本体,并配套一个包含731个实例、147个类别的物体库。通过Easy和Hard两种环境,测试机器人能否从仿真走向更复杂的真实世界。早期结果显示,在Hard设定下,多数方法的成功率仍然低于20%。机器人能够完成特定任务,但距离稳定、泛化地完成任务,还有很长的路要走。

图:RoboTwin 2.0官方榜单(来源:robotwin-platform.github.io,2026年7月截图)
三张榜单,三种能力,各自拥有不同的发布机构和评分体系。没有一张榜单能独自定义世界模型,将它们放在一起,才能勾勒出一条从生成、理解到行动的能力链。但这条链条还缺少一个最关键的环节。
Physics-IQ:回答“准不准”
人类在做许多动作时,会下意识地在脑中预演结果。推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出来;把两块磁铁靠近,它们会吸住还是弹开。机器人也需要这种能力。它必须根据眼前的状态,预测几秒后会发生什么,再决定下一步动作。视频世界模型经常在这里犯错。这类预测如果不准确,后续的规划和执行都无从谈起。测量这一基础能力的基准叫做Physics-IQ,由Google DeepMind与INSAIT联合推出,论文发表于WACV 2026。2026年6月,原团队联合Anates Labs发布了修正版Physics-IQ Verified,修正了57.6%的样本标注问题,改用逐样本加权计分。

它的设计与前述榜单都不同:研究者真实拍摄了66个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验使用3个机位、实拍2次,共获得396段8秒视频。模型只观看前3秒,预测后5秒会发生什么,再与真实拍到的后续画面进行比对。4项指标合成一个0到100分的Physics-IQ分数,并用同一场景两次实拍之间的差异做归一化处理:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来与这种自然波动进行比较。Physics-IQ考察的是更底层的问题,即这个模型是否真的理解物理规律。这也正是图灵奖得主Yann LeCun多年来反复主张的观点,“AI需要建立关于世界的内部模型,而不是只会生成内容”。他担任Meta首席科学家期间,Meta FAIR便将Physics-IQ作为核心评测基准。
然而翻开Physics-IQ的官方榜单,排在第一的却并非Meta的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。2025年4月21日,Sand.ai的Magi-1以56.0%的得分登顶榜首。当时位居榜首的Google VideoPoet仅有29.5%,Magi-1几乎将这个数字翻了一倍。从那天算起,Magi-1系列在第一名的位置上坐了约13个月,中间只离开过三周。这张榜单有三种解读方式:
- 看裸模型:前三名里有两个建立在Magi-1之上,Magi-1的56.0%是v2v设定下的裸模型最高分,远高于Sora 2裸模型的42.3%,Cosmos3-Super裸模型的59.7%出自不同设定,两者不直接可比。
- 看增强系统:2026年5月,英伟达最新发布的旗舰世界模型Cosmos3-Super加持WMReward后冲到63.4%,短暂登顶约三周;6月17日,基于Magi-1的增强系统以64.5%重回第一。

图:Physics-IQ官方榜单:Magi-1系居首,Sora 2裸模型42.3%(来源:physics-iq.github.io,2026年7月截图)
- 再看修正后的新榜:2026年6月发布的Verified版本上,Magi-1 24B增强版以58.2分排第一,裸模型48.4分排第二,Cosmos3-Super i2v 39.5分,Sora 2仅有26.5分。

图:Physics-IQ Verified修正榜(来源:physics-iq-verified.anates.ai,2026年7月截图)
将两张榜单放在一起看,会出现一个反常识的画面。OpenAI的Sora在VBench这类回答“像不像”的榜单上排名并不差,但到了Physics-IQ上,Sora 2裸模型仅有42.3%,不足榜首64.5%的三分之二;Verified新榜上只有26.5分,不及榜首58.2分的一半。生成得逼真,与预测得准确,被证明是两件不同的事。
把视频生成做成“预测下一个词”
Magi-1赢在哪里?论文给出的答案是架构选择。当下主流的视频生成模型,如Sora、Kling等,走的是扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后顺序。而Magi-1的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块24帧,块内部使用扩散去噪保证画质,块与块之间通过自回归方式衔接。通过block-causal attention,后来的帧不会影响过去的帧,过去一旦被写下,就不再被改变。

图:Magi-1逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211)
这个架构天然更接近世界模型应该做的事情:根据世界的此刻,推演下一秒。它还带来几个工程上的优势:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以一直进行,还可以逐块更换提示词,控制后续走向。如果将关键词从“生成”换成“预测”,Magi-1与LeCun主张的JEPA路线便有一种理念上的深层呼应。LeCun在2022年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出JEPA架构:不在像素空间预测世界,而是在表征空间进行预测,主动忽略那些不可预测的细节。这条路线后来发展成一个家族:I-JEPA、V-JEPA,再到2025年的V-JEPA 2,用百万小时视频进行训练,其衍生版本可以做零样本的机器人规划。

图:Yann LeCun在2026年6月巴黎VivaTech演讲(来源:La Ecuación Digital)
一个在像素世界里逐块自回归,一个在表征空间里做预测,虽然技术方案完全不同,但都指向同一个判断:能够预测物理世界的变化,是世界模型的必要条件。
尺子一旦出现,叙事便有了边界
在WAIC的论坛上,“世界模型”被反复提及。7月19日的一场人形机器人与具身智能论坛,主题之一正是“标准体系不统一”。开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。竞争的坐标系确实在发生变化。过去几年,视频模型的发布会比拼的是“像不像”:分辨率、时长、美学分数。Physics-IQ这类榜单的出现,将问题转变为“物理世界变化预测的准不准”。它的价值不在于新添了一张榜单,而在于将世界模型从一个抽象概念,拉回到具象的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。这些东西无法靠话术修饰。坐标系的变化不会写在任何一场发布会的邀请函上,但它会决定下一年资本流向哪里、人才流向哪里。榜单会迭代,名次会更替。但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。尺子一旦有了,能量出什么,就是什么。
