游乐游手机版
首页/AI热点日报/热点详情

WAIC世界模型六小龙激辩行业红利藏于非共识

类型:热点整理2026-07-22
世界模型概念、技术路线、评价标准尚未统一,WAIC论坛上六家公司围绕像素生成、隐空间、融合三派路线展开分歧。物理理解精度与合理性、长时推演与时效性等观点碰撞,未来收敛方向可能在统一表征、融合、触觉或评测标尺上。部署阶段更看重稳定性和成本。

世界模型,无疑是当前AI领域最受关注、也最缺乏统一标准的赛道之一。

它的概念尚未达成共识,技术路线、训练方式、数据标准、评测尺度等几乎所有维度都仍在“摸着石头过河”,各方探索路径各异。

7月19日,WAIC上那场被称为“世界模型六小龙”的论坛,汇聚了六家公司的技术负责人,展开了一场信息量丰富的圆桌讨论。他们分别是:

大晓机器人首席科学家陶大程(主持人)
蚂蚁灵波首席科学家沈宇军
极佳视界联合创始人兼首席科学家朱政
无界动力联合创始人兼CTO夏中谱
智元机器人AI算法总监任广辉
自变量机器人联合创始人兼CTO王昊

这些嘉宾分享的观点,基本代表了行业对世界模型前沿思考的深度与广度,值得深入分析。

世界模型的核心能力:关键分歧与共识

共识相对明确,但真正值得关注的其实是分歧所在。

先看技术路线之争。目前这六家公司押注的方向,按“模型在什么空间里推演世界”这把尺子,大致可划分为三派:

像素生成派——以极佳视界为代表
隐空间(JEPA)派——以无界动力为代表
融合派——包括大晓机器人(理解生成预测一体化)、蚂蚁灵波(推出了多条路线的世界模型全家桶)、自变量机器人、智元机器人

路线不同,自然对焦点问题的看法也大相径庭。

例如:世界模型到底该对物理世界理解到什么程度?

一方希望它尽可能接近物理模拟器。无界动力的夏中谱提出,评价世界模型要看它对几何、运动、力等状态的预测精度。

另一方则认为,机器人没必要先成为物理学家。蚂蚁灵波的沈宇军强调,“物理合理性”比“物理精度”更重要。机器人只需要知道同样重量的铁比棉花掉得快,但具体快多少,无需精确计算,靠观察即可。

他指出,机器人不必算清每一条轨迹、复现每一个物理参数,只要知道哪些差异会影响当前动作,这已经足够应对任务。

对模型能力评价的标准,嘉宾们也存在分歧。

智元的任广辉认为,推理的长时物理一致性,是评价世界模型能力必不可少的指标之一。

而自变量的王昊却直言:长程推演是“伪需求”,他更看重推理的时效性。如果推理慢到错过决策窗口,再完整的理解也失去实际意义。

这些观点碰撞背后,其实各家公司捍卫的是自身模型擅长的能力。隐空间里可以直接回归物理量,所以敢要求物理精度;像素生成学到的天然是“看起来合理”,所以只承诺物理合理性。

至于长时一致性,智元的世界模型一大用途是作为仿真器,长程推演正是仿真器的生命线;自变量把世界模型与VLA整合进同一个端到端框架,预测是动作生成的前置步骤,预测铺得越长推理就越慢,占掉的决策时间就越多。

率先收敛的方向:技术路线与评测基准

除了技术路线之争,世界模型在下一阶段最可能先收敛的是什么?各方的判断也不尽相同。

任广辉和夏中谱认为是统一表征。语言模型找到了token,具身智能还没找到自己的“token”,视觉、语言、动作这些模态需要对齐进同一个表征空间。

王昊押的是融合——视频生成贡献未来预测、隐空间贡献推理、3D显式建模充当空间记忆,各取所长拼出新架构,这在大语言模型历史上曾发生过一遍。

沈宇军的押注则落在触觉上。他笃定,下一阶段行业会率先形成共识:触觉将成为机器人不可或缺的模态。触觉数据一旦突破,物理世界和数字世界的世界模型将分道扬镳。

如今许多机器人的世界模型,从数字世界的视频生成模型迁移而来;蚂蚁灵波则在开发具身原生的世界模型,从控制执行的需求出发、基于自回归架构从头预训练,让模型为“边预测、边行动”设计,而非为生成好看的画面。

陶大程认为,世界模型最近的收敛不会发生在某一条技术路线上,而是发生在一把横向的评测标尺上。他举例,就像深度学习的爆发,不是神经网络在论战里说服了特征工程派,而是ImageNet把所有方法拉到同一把尺子下。标尺统一了,收敛自然就会发生。

大晓机器人在论坛期间发布了PHYSICAL IQ,定位为首个具身原生、面向多场景、多本体、多任务的物理智能评测基准平台,公平量化不同机器人本体与世界模型的物理智能水平。

从Demo到规模化部署:现实挑战与解决路径

虽然各家的技术路线存在分歧,但当机器人进入物理世界,最终的评价标准会变得很朴素:它能不能稳定完成任务?

按照夏中谱的定义,叫“决策有效性”;任广辉说的偏技术,“最终为policy提升多少指标”;朱政的定义则是“多任务真机成功率”。这些指标名称不同,但目标殊途同归。

Demo稳定完成任务并不难,因为为了一个Demo可以不计成本。真正难的是在真实世界中规模化部署(Deployment)。

王昊分享了一个规律:模型能力从90%提升到99%,再从99%提升到99.9%,投入的成本并不是线性增长。实验环境里看似微小的错误率,落到部署现场,可能就是一次次人工接管、一次次返工,最后变成一笔算不过来的账。

对随机和突发情况的应对能力,也是机器人走出实验室后必须要补上的短板。沈宇军举了商超里的例子:机器人要找一包蔬菜,顾客却可能顺手把它放进了牛奶柜。单独一起事件,可能是偶发情况;但对每天面对不同顾客的机器人来说,这就是日常。

大晓机器人的陶大程强调了端侧能力对于部署的重要性。很多世界模型跑在云端,但机器人留给自己做判断的时间,可能只有几十毫秒到几百毫秒。网络不能永远在线,云端也不能总在等待。他说,最难的不是让模型变聪明,而是让聪明变得便宜、可靠、及时。

一句话总结:Demo展示的是能力上限,部署则考验能力下限。

最后,还有一个问题值得深思:世界模型今年上半年才真正火起来,如果两年后回看,眼下的什么做对了,什么做错了?

沈宇军说,行业有时把“模型的能力”和“模型展现出来的能力”混淆了。模型的能力是泛化效率、可交互性这类内在属性;展现出来的能力是生成效果这类外在呈现。他认为,两年后看,所有为模型架构能力做的工作,都做对了,但过于追求模型呈现出来的能力,并不好说;所有为数据链路做的准备,都做对了,但当下积累的数据最终是否会被用到、是否会被更新迭代,并不好说。

朱政说,眼下模型之外的太多事情分散了精力。在基模尚未收敛的时候,就去探索非常多的商业化场景,大概率不会成功。

任广辉称,两年后,世界模型会走向更加“具身原生”,需要更大规模的具身原生数据和为具身而生的原生架构。

这场持续一小时左右的圆桌,讨论了世界模型最值得关注的几个话题,呈现出行业现阶段代表性的共识和分歧。陶大程的总结说得很好:分歧是论文的素材,重叠是产业的基底。对整个行业而言,分歧并不是问题,反而是当下的红利。

来源:https://36kr.com/p/3905463018984582

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。