游乐游手机版
首页/科技数码/文章详情

上海AI Lab最新世界模型综述 一文读懂

时间:2026-07-19 11:46
“世界模型”这一概念,当前在人工智能领域热度极高,却也被频繁提及甚至滥用。无论是视频生成还是机器人领域,似乎都在将各自的技术成果纳入“世界模型”的范畴。然而,其核心定义究竟是什么?应当预测哪些内容?如何构建?业界至今仍缺乏共识。恰逢其时,上海AI Lab团队近期发布了一篇综述,系统性地梳理了这一概念

“世界模型”这一概念,当前在人工智能领域热度极高,却也被频繁提及甚至滥用。无论是视频生成还是机器人领域,似乎都在将各自的技术成果纳入“世界模型”的范畴。然而,其核心定义究竟是什么?应当预测哪些内容?如何构建?业界至今仍缺乏共识。

恰逢其时,上海AI Lab团队近期发布了一篇综述,系统性地梳理了这一概念。该研究对世界模型进行了科学界定,整理了现有的训练方法及关键技术难题,并勾勒出一条通往有效世界模型的阶段性发展路线图。


论文链接:https://arxiv.org/abs/2607.06401

研究团队在文中提出了一个颇具启发性的框架:通往物理AGI的三位一体架构。在该架构中,Agent负责执行任务,Evaluator评估轨迹,而World Model则负责吸收交互数据并生成新任务。这意味着,世界模型的功能远不止于预测未来,它还能赋能AI从静态数据学习转向主动交互与自我进化。


图|三位一体架构概览。

世界模型到底是什么?

研究团队给出了一个简洁的定义:世界模型是在有限计算资源约束下,对物理世界状态转移过程的压缩建模。一个通用的物理世界模型,天然具备三个核心属性。

第一,全模态工作范围。世界模型不能仅处理文本或图像,它必须能够建模所有感知模态的数据,本质上是统一各种感知信号的全模态基础模型。

第二,多维异步性。现实世界数据是多模态、频率不一的,世界模型必须能够处理这种多维、异步的序列数据。

第三,局部性。Agent的感知与计算能力有限,其收集的数据通常仅覆盖局部区域,且该区域并非封闭,会持续受外部环境影响。因此,局部化建模通常被形式化为部分可观测马尔可夫决策过程,即POMDP。


图|世界模型的本质及其主要特性的示意图。

从功能角度,世界模型可拆解为三大模块:渲染器、模拟器和规划器。渲染器负责将状态转化为可感知结果,如图像或视频;模拟器承载动态,预测世界状态如何演化,并保持物理、几何与物体一致性;规划器则评估各种可能结果,从中选出最优方案。这三个模块并非孤立,而是在POMDP的闭环决策过程中相互调用、协同更新。


图|世界模型在 POMDP 循环中的功能角色。

在架构上,当前世界模型大致分为三类:观测级模型、潜空间模型,以及3D增强与对象中心模型。一个明显的趋势是,业界正朝着全模态世界模型的方向发展。

观测级生成式世界模型,直接生成未来的像素、视频或体素,将世界建模视为高维观测合成。这类模型可借助大规模视频数据学习外观、运动与场景动态,生成视觉上逼真的未来画面。但问题在于,视觉逼真不等于物理正确。此类模型在长时间模拟中,易出现物体恒常性受损、接触关系错误、因果链条断裂或场景不一致等问题。因此,评判这类模型的关键,不仅在于画面真实性,更在于轨迹在动作、指令或场景条件下是否保持物理一致、因果连贯与可控性。

潜空间世界模型则另辟蹊径,将高维观测压缩成紧凑状态,并在此潜空间中进行预测与规划。PlaNet、Dreamer等方法通过“想象”未来轨迹,使Agent能以较低计算成本处理长时程与部分可观测问题。其价值在于能保留几何、对象关系、可供性及接触动态等对决策至关重要的信息,而无需重建所有像素细节。但风险同样明显:过度抽象易丢失夹爪接触、细微障碍或物体姿态等关键线索。

3D增强与对象中心世界模型,则将世界建模从帧预测推进到结构化场景理解。3D占据与BEV适合空间与障碍物推理,NeRF与3D Gaussian能提供视角一致的几何状态,对象中心方法则能捕捉实体级的动态与组合关系。一个更有前景的方向,是将空间、时间、对象与交互信息整合为共享的物理表征。但需警惕的是,引入3D结构并不等同于理解世界。模型仍可能无法处理可供性、因果性、任务语义或长时程交互。一个真正强大的世界模型,应同时实现几何一致、时间稳定、对象明确、物理合理,并能服务于下游的推理、规划与控制。

统一趋势已非常明显:全模态世界模型。未来的统一模型,需要能同时理解当下、想象未来、生成动作,并整合视觉、语言、空间、动作与物理信号。面向物理AI,世界模型不仅要做理解和预测,更需指导实际行动。


图|二维分类框架:功能与架构。

世界模型的训练与学习范式

世界模型的训练与学习,可视为一条从经验输入到可靠行动的闭环路径。首先从自监督预训练、具身交互、仿真数据与物理先验中学习世界表征,随后通过潜在想象与基于模型的强化学习(MBRL)循环,将预测能力转化为可靠的行动。

1. 经验与先验输入

世界模型首先通过自监督与生成式预训练,从无标注视觉数据中学习基础表征,典型方式包括视频预测、掩码自编码、下一个token预测与扩散潜空间。随后,具身交互通过状态-动作-奖励数据,补充动作与结果之间的关系,必要时可结合好奇心或内在奖励驱动探索。合成与仿真数据用于扩展覆盖范围,特别是长尾、危险与反事实场景。物理先验与约束,如PINNs、常微分方程、守恒规律与接触可行性,则用于增强物理一致性。

2. 世界模型学习核心

获得经验与先验后,世界模型将观测压缩成紧凑的信念状态,并学习一个“动作条件转移先验”,用于预测不同动作下状态的变化。在此基础上,模型进一步估计奖励、价值与不确定性,并在潜空间中展开想象轨迹,为后续的规划与策略学习提供依据。

3. 决策与推理接口

进入决策阶段,世界模型通常嵌入MBRL循环:先从交互中学习动态模型,再利用该模型进行规划或策略优化。模型可在潜空间中进行后台滚动,并结合模型预测控制、交叉熵方法或蒙特卡洛树搜索完成规划与搜索;也可在模型内部直接学习策略,如Dreamer的actor-critic,或像WAM那样联合生成未来与动作。至于反事实推理,模型需在同一背景下比较不同动作可能导致的不同结果;对于长时程任务,模型则需借助子目标、技能与记忆机制,将复杂任务分解为更可执行的规划过程。

4. 可靠具身行动

当世界模型应用于真实机器人时,模型偏差、仿真到现实的差距、累积误差与目标错配都可能影响执行可靠性,并可能带来乐观或悲观偏差。因此,模型需通过校准与自我改进循环不断修正,借助不确定性感知的数据采集,将内部预测与真实反馈对齐。


图|世界模型主要训练与学习范式概览。

世界模型的路线图

研究团队指出,构建一个扎实的未来物理世界模型,需分三步走。

第一步,构建统一多模态世界模型。模型需能整合图像、视频、3D结构、状态、动作与语义推理等异步信号。这一过程应通过渐进课程学习实现:先建立稳定的图像语义理解,再逐步引入视频、状态、动作与具身数据,最后用紧凑的潜在动作区分可控变化与背景外观。

第二步,学习统一物理表征。多样化的模态需被蒸馏成高度压缩的内部状态,使渲染、仿真与规划均可从该状态中解码出下游任务所需信息。该表征需具备物理基础、仿真就绪、几何自适应与紧凑性,同时保留动态、接触、因果结构等对决策至关重要的信息。PhysGaussian已展示出早期方向,但如何学到一种可演化、持久且融合外观、物理与语义的紧凑状态,仍是核心挑战。

第三步,扩展为基础规模交互式模拟器。未来的世界模型,应成为一个闭环、可复用的环境,让Agent在实际执行前,能安全地探索、评估与优化动作。这需要可控的交互架构,融合力觉、触觉、接触与本体感受等物理基础数据,并通过严格的闭环验证,确保预测符合动作因果、长期稳定性与真实执行结果。


图|下一代世界模型发展的阶段性路线图。

不足与未来方向

研究团队也坦诚指出,当前世界模型在真实交互、安全约束与长时程控制上,仍存在诸多短板。

首先是数据不对称问题。渲染器可借助海量图像与视频学习外观,但模拟器与规划器所需的数据则较为稀缺,如仿真资产、机器人轨迹、任务结果、触觉与力反馈。未来,世界模型仍迫切需要普遍、非侵入、连续的真实世界交互数据反馈。

感知保真度与物理精度不匹配,也是一个长期难题。视觉上逼真的未来画面,不一定在物理上合理、可执行或可规划。未来,世界模型不能仅追求画面真实感,还需能预测可行动的结果,并借助3D几何、接触、力、材料、任务反馈以及闭环反馈持续校准。

累积预测误差问题也需警惕。一步预测的误差在长时程滚动中会被递归放大,甚至可能被规划器利用,生成现实中无法执行的高价值轨迹。因此,未来世界模型需降低一步预测误差,并确保预测误差在决策时间尺度上有界、可校准、可控。

仿真到现实的迁移,同样是一个绕不开的坎。仿真与真实物理之间总有残差,尤其在接触丰富、部分可观测与高维动作的场景中。未来,世界模型仍需结合本体感受、触觉、力反馈与结构化机器人状态,并借助物理归纳偏置、状态表征与推理时的自适应校正,来缩小差距。

评估与基准方面,目前仍较为碎片化。视频模型关注视觉质量,控制任务看重成功率,机器人系统则强调泛化与安全。对于面向真实交互的世界模型,评估体系需覆盖因果一致性、动作可控性、长时程稳定性、物理基础、闭环执行与低延迟推理,同时还需平衡可复现性与现实复杂度。

最后,安全、透明性与可持续性。物理世界模型在真实部署中,还面临安全探索、风险评估、推理约束与不确定性控制等挑战。未来,它还需处理人机对齐、环境反馈与多Agent协调,并借助控制理论与形式化验证,提供可解释、可验证的稳定性保证。

更多技术细节,详见原论文。


来源:https://www.163.com/dy/article/L1D4OB4H0531E3NX.html
上一篇钛镁AI蔡晓旭谈构建AI信任资产与穿透算法迷雾 下一篇高盛重磅发声做多中国AI价值链
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
中科量枢4个月两轮融资,打造量子计算全栈软件生态
科技数码 · 2026-07-20

中科量枢4个月两轮融资,打造量子计算全栈软件生态

中科量枢成立4个月完成两轮融资,团队源自中科院计算所,具备二十余年量子计算理论与算法研究经验。公司打造“天枢”操作系统、“天璇”编译平台及“天玑”算法库,构建全栈式软件生态,与中石油勘探院合作推动量子计算在油气勘探等领域的应用落地。

比亚迪巴西工厂第10万辆新能源车下线员工超5500人
科技数码 · 2026-07-20

比亚迪巴西工厂第10万辆新能源车下线员工超5500人

比亚迪巴西卡马萨里工厂投产满一年,第10万辆新能源汽车下线,车型为海鸥。工厂在岗员工超5500人,总投资约55亿雷亚尔,一期年产能15万辆。计划2026年底实现半数零部件本地化,已获阿根廷和墨西哥10万辆出口订单。

三星晶圆代工部门超八成员工因奖金不满欲离职
科技数码 · 2026-07-20

三星晶圆代工部门超八成员工因奖金不满欲离职

三星电子晶圆代工部门超八成员工因奖金差距巨大有意离职,离职意向是存储器部门的两倍以上。工会警告危机感突出,已着手研讨人才留存对策。

无问芯穹在AGI到来前构建前店后厂一中心
科技数码 · 2026-07-20

无问芯穹在AGI到来前构建前店后厂一中心

无问芯穹发布面向Agent时代的“前店后厂一中心”架构,涵盖算力集散中心、Token工厂和AI生产力商店,旨在解决算力异构与跨域协同难题,提升Token生产效率,并通过智能体蜂群优化基础设施运维,实现用智能进化智能。

WAIC青年论坛把AI圈真话全说了
科技数码 · 2026-07-20

WAIC青年论坛把AI圈真话全说了

在WAIC青年论坛上,多位从业者围绕模型格局、垂直AI、Agent确定性、具身智能机会、运动健康垂类模型、数据重要性及14岁AI原生思考等话题展开讨论,直言行业正从炫技转向较真付费与落地。