今年七月,上海世博展览馆H3馆的过道显得格外拥挤,具身智能与视频生成领域的企业齐聚一堂,成为2026年WAIC大会最受关注的展区。
入口处,宇树科技的载人变形机甲GD01吸引大批观众排队体验,进入驾驶舱拍照留念。展区内,300余台真实机器人分布于200多家具身智能企业展台之间,充分彰显了具身智能作为本届WAIC核心展品的地位。视频生成公司的展台则紧邻机器人企业,屏幕连成一片,持续播放着机械臂倒水、无人机穿越林间、虚拟角色转身等演示内容。
各家公司的讲解员不约而同地聚焦于两大主题:具身智能与世界模型,成为展会现场最热门的话题。
图:WAIC 2026现场,宇树科技展台(来源:新蓝网)
投资人穿梭于展台之间,面对众多公司,他们反复询问高度趋同的问题,核心始终聚焦于模型的实际水平。但获得的答案却指向不同维度:有人展示VBench排名,有人调出RoboTwin 2.0的任务成功率曲线,还有人谈论仿真到真机的迁移数据。同一词汇,在不同展台上被不同的数字重新定义。
当具身智能与世界模型成为显学,这些评测榜单已不再是技术社区的内部排名,而是行业理解技术路径的关键窗口,甚至代表了话语权本身。
一张拼图,三大榜单
2026年以来,具身智能与世界模型已成为人工智能领域最受关注的两大核心议题。
技术圈在探讨,视频模型能否成为机器理解物理世界的有效路径。资本圈在思考,下一代AI公司能否从“会说话的模型”进化为“会理解、会预测、会行动的模型”。媒体圈的问题则更为直接:面对越来越多的“世界模型公司”,究竟该如何评估其真实实力?
然而,迄今为止,世界模型仍缺乏统一的定义和衡量标准。
具体到评测层面,世界模型目前并非单一分数所能概括的能力,它更像一张尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测,每一项能力背后都伴随着相应的榜单和一群拥趸。
那么,具身智能与世界模型究竟该关注哪些榜单?将这张拼图拆解,有三块版图不可或缺:一张回答“像不像”,一张回答“懂不懂”,一张回答“动不动得了”。理解它们,比看任何发布会都更能把握行业的真实进度。此外,还有一块回答“准不准”,它是整张拼图的底座,值得单独辟出一章详细阐述。
VBench:回答“像不像”
VBench是目前视频生成领域最常用的评测体系之一,由南洋理工大学S-Lab、上海人工智能实验室OpenGVLab等机构联合推出。它从主体一致性、背景一致性、运动流畅度、美学质量等16个维度对生成视频进行全面评估。
它回答的问题非常直接:模型生成的视频是否像真实世界,是否符合用户输入指令。
在VBench 1.0认证榜中,头部模型分数集中在84分至88分之间,差距已微乎其微。因此,VBench于2025年推出2.0版本,将评测范围扩展至人类保真度、物理规律、可控性、常识等维度,开始关注那些决定真实感却常被忽略的细节。
根据其HuggingFace官方榜单的认证视图,主要排名如下:
图:VBench-2.0榜单:Veo 3以66.72%居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026年7月截图)
但VBench仍主要评价视频输出结果。画面可以极为逼真,模型却未必理解画面背后的物理规律。
WorldModelBench:回答“懂不懂”
如果视频生成模型被称为“世界模型”,那么它就必须接受更严格的检验。
2025年,来自UC Berkeley、UC San Diego、NVIDIA和MIT的研究人员联合推出了WorldModelBench,将模型置于物理和常识环境中进行测试。
该评测覆盖机器人、驾驶、工业、人类活动等七大领域,包含350条提示词和6.7万条人工标注,从指令遵循、物理规律、常识三个维度进行评分。其中物理规律遵循占总分的一半。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中如何变化。
结果显示,即使表现最好的模型,也只有61%的视频正确完成指令;12%的视频违反质量守恒定律,11%出现物体互相穿透现象。
模型能够生成一个看似合理的世界,但距离真正理解物理世界,仍有明显差距。
图:WorldModelBench官网榜单(来源:worldmodelbench-team.github.io,2026年7月截图)
RoboTwin 2.0:回答“动不动得了”
世界模型终究要服务于行动,因此,再向拼图下游走一步,机器人能否实际执行任务便成为一个至关重要的维度。
RoboTwin 2.0由上海交大ScaleLab与港大MMLab主导,上海人工智能实验室参与。它包含50个双臂协同操作任务,涵盖抓取交接、工具使用、可形变物体操作等场景,运行于SAPIEN仿真器,支持Aloha-AgileX、ARX-X5、Piper、Franka、UR5共五种双臂本体,并配备一个包含731个实例、147个类别的物体库。通过Easy和Hard两种环境设置,测试机器人能否从仿真走向更复杂的真实世界。
早期结果显示,在Hard设定下,多数方法成功率仍低于20%。机器人能够完成特定任务,但距离稳定、泛化地完成任务仍有很大差距。
图:RoboTwin 2.0官方榜单(来源:robotwin-platform.github.io,2026年7月截图)
三张榜单,三种能力,各有其发布机构和评分体系。没有一张榜单能独自定义世界模型,但将它们放在一起,才能勾勒出一条从生成、理解到行动的能力链。然而,这个链条还缺少一个最关键的环节。
Physics-IQ:回答“准不准”
人类在做出许多动作时,会下意识在脑中预演结果。例如,推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出;把两块磁铁靠近,它们会吸住还是弹开。
机器人也需要这种能力。它必须根据当前状态,预测几秒后会发生什么,再决定下一步动作。视频世界模型经常在这一环节犯错。如果这类预测不准,后续的规划和执行都将无从谈起。
衡量这一基础能力的基准称为Physics-IQ,由Google DeepMind与INSAIT联合推出,相关论文发表于WACV 2026。
2026年6月,原团队联合Anates Labs发布了修正版Physics-IQ Verified,修正了57.6%的样本标注问题,并改用逐样本加权计分方式。
其设计与前述榜单截然不同:研究者真实拍摄了66个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验设置3个机位、实拍2次,共获得396段8秒视频。模型仅观察前3秒,预测后5秒会发生什么,再与真实拍摄的后续画面进行比对。4项指标合成一个0到100的Physics-IQ分数,并用同一场景两次实拍之间的差异做归一化处理:真实世界重拍一次也不会完全相同,模型的预测便与这种自然波动进行比较。
Physics-IQ考察的是更底层的问题:模型是否真正理解物理规律。这也正是图灵奖得主Yann LeCun多年来反复强调的观点——‘AI需要建立关于世界的内部模型,而不仅仅是生成内容’。在他担任Meta首席科学家期间,Meta FAIR便将Physics-IQ作为核心评测基准。
然而,翻开Physics-IQ官方榜单,排名第一的并非Meta的模型,也不是英伟达重金投入的Cosmos,而是一个来自中国的视频生成模型。
2025年4月21日,Sand.ai的Magi-1以56.0%的得分登顶。当时的榜首Google的VideoPoet仅有29.5%,Magi-1几乎将这个数字翻了一倍。从那时起,Magi-1系列在榜首位置坐了约13个月,期间仅离开过三周。
这张榜单有三种解读方式。
- 看裸模型:前三名中有两个基于Magi-1,Magi-1的56.0%是v2v设定下的裸模型最高分,远高于Sora 2裸模型的42.3%。Cosmos3-Super裸模型的59.7%出自不同设定,两者不直接可比。
- 看增强系统:2026年5月,英伟达最新发布的旗舰世界模型Cosmos3-Super结合WMReward后冲到63.4%,短暂登顶约三周;6月17日,基于Magi-1的增强系统以64.5%重回第一。
图:Physics-IQ官方榜单:Magi-1系居首,Sora 2裸模型42.3%(来源:physics-iq.github.io,2026年7月截图)
- 再看修正后的新榜:2026年6月发布的Verified版本上,Magi-1 24B增强版以58.2分排第一,裸模型48.4分排第二,Cosmos3-Super i2v 39.5分,Sora 2仅有26.5分。
图:Physics-IQ Verified修正榜(来源:physics-iq-verified.anates.ai,2026年7月截图)
将两张榜单放在一起对比,会出现一个反常识的画面。OpenAI的Sora在VBench这类回答“像不像”的榜单上名次并不差,但在Physics-IQ上,Sora 2裸模型仅有42.3%,不足榜首64.5%的三分之二;Verified新榜上只有26.5分,不到榜首58.2分的一半。
生成得逼真与预测得准确,被证明是两回事。
把视频生成做成“预测下一个词”
Magi-1为何胜出?论文给出的答案是架构选择。
当前主流的视频生成模型,如Sora、Kling等,均采用扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后顺序。
而Magi-1的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块24帧,块内部通过扩散去噪保证画质,块与块之间通过自回归衔接。利用block-causal attention机制,后续帧不会影响过去帧,过去一旦被生成,便不再被修改。
图:Magi-1逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211)
这个架构天然更接近世界模型的目标:根据世界的此刻,推演下一秒。它还带来几个工程上的优势:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以持续进行,还可以逐块更换提示词,控制后续走向。
如果将关键词从“生成”换成“预测”,Magi-1与LeCun提出的JEPA路线便有了理念上的深层呼应。LeCun在2022年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出JEPA架构:不在像素空间预测世界,而是在表征空间预测,主动忽略那些不可预测的细节。这条路线后来发展成一个家族:I-JEPA、V-JEPA,再到2025年的V-JEPA 2,利用百万小时视频训练,其衍生版本可进行零样本的机器人规划。
图:Yann LeCun在2026年6月巴黎VivaTech演讲(来源:La Ecuación Digital)
一个在像素世界里逐块自回归,一个在表征空间里做预测,虽然技术方案完全不同,但都指向同一个判断:能够预测物理世界变化是世界模型的必要条件。
尺子一旦出现,叙事便有了边界
在WAIC论坛上,“世界模型”被反复提及。7月19日的一场人形机器人与具身智能论坛,主题之一正是“标准体系不统一”。开幕当天便有观察文章指出:通用世界模型正在成为人形机器人的新竞争壁垒。
竞争的坐标系正在发生平移。过去几年,视频模型发布会比拼的是“像不像”:分辨率、时长、美学评分。Physics-IQ这类榜单的出现,将问题转向了“物理世界变化预测的准不准”。其价值不在于新增一张榜单,而在于将世界模型从一个抽象概念,拉回到具体的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。这些无法通过话术修饰。坐标系的变化不会出现在任何一场发布会的邀请函上,但它将决定下一年资本流向哪里、人才流向哪里。
榜单会迭代,名次会更替。但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。
尺子一旦有了,量出什么,就是什么。
