近年来,视频生成模型在具身智能领域持续升温。从UniPi、SuSIE到各类以动作条件生成的视频变体,其核心思路高度一致:先让模型生成一段预测视频,随后从中提取动作信号,由机器人按指令执行。
然而,一个长期未解的难题始终存在——2D像素预测与3D物理世界之间,存在着本质性的表征鸿沟。这一鸿沟主要体现在以下三个方面。
首先,2D视频缺乏深度信息。机器人需要精确掌握目标物体与末端执行器之间的实际距离,例如30厘米还是50厘米,而纯像素预测仅能提供物体在画面中的大致位置,无法支撑精细操控。
其次,2D模型缺少显式的运动场。像素预测能反映物体发生了位移,却无法指明每个像素在三维空间中的具体移动方向与距离。而末端执行器的关节角度,恰恰需要从这种三维运动中推导得出。
最后,缺乏几何约束的视频生成,极易产生“物理幻觉”。同一物体在相邻帧间出现尺度变化或形状变形,本该碰撞的物体相互穿透。这些瑕疵对人眼影响或许不大,但对依赖精确控制的机器人而言,却是显著的信号噪声。
阿里巴巴达摩院的最新工作RynnWorld-4D,正是针对这一痛点——世界模型在生成视频的同时,一并输出深度与光流,直接提供带有几何结构与运动轨迹的4D预测。
论文标题:RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
项目主页:https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io
论文链接:https://arxiv.org/abs/2607.06559
代码链接:https://github.com/alibaba-damo-academy/RynnWorld-4D
表征设计:RGB-DF构成物理锚定的4D表征

图1:RynnWorld-4D整体流程。给定单张RGB-D图像与一条语言指令,模型在同一扩散过程内同步生成未来的RGB视频、深度图序列与光流场。
RynnWorld-4D的第一个设计选择,是采用RGB-DF(RGB + Depth + Flow)表征,而非RGB-DN(RGB + Depth + Normal)或3D Gaussian / NeRF。
表面法线(Normal)描述的是静态几何属性,例如某个表面的朝向,适合静态重建;但操作任务更关注物体上某一点的运动方向与位移大小。光流则提供了每个像素在相邻帧之间的2D位移;在已知深度图的前提下,这个2D位移可以反投影回3D空间,获得三维场景流(3D Scene Flow)。
深度图给出每个点在三维空间中的位置,光流指明它在下一帧的去向,两者结合,便构成了完整的逐点三维运动矢量。这一表征与机器人的动作空间天然对齐——末端执行器的位移,本质上就是三维空间中的轨迹。相比让策略网络从纯像素变化中隐式推断三维运动,显式提供运动场显然更为高效。
至于为何不采用NeRF或3DGS,原因在于:这类方法几何精度虽高,但需要多视角输入,且难以继承大规模视频扩散模型的生成先验。RGB-DF保持了2D对齐形态,可以直接在Wan 2.2这类强视频模型基础上扩展,从而复用已有的纹理生成能力。
架构设计:三分支协同与跨模态对齐

图2:RynnWorld-4D架构总览。三分支Transformer分别建模视觉纹理、空间几何与运动轨迹,并通过联合跨模态注意力(JA)与帧级3D RoPE实现跨模态对齐。
RynnWorld-4D的架构核心在于:三种模态各自保留独立的特征空间,然后在关键节点强制对齐。
具体实现是三分支Transformer,基于Wan 2.2-TI2V-5B(30层DiT,hidden dim 3072)扩展。每个分支拥有独立的self-attention和FFN,分别处理RGB纹理、深度几何和光流运动。消融实验表明,如果三种模态共享FFN,性能会明显下降,原因在于纹理、几何与运动的潜在空间本质上是异质的,共用同一非线性变换会造成表示干扰。
为了保证三条分支相互对齐,模型引入了联合跨模态注意力(Joint Cross-Modal Attention, JA):每隔3个Transformer block插入一个JA模块,共计10个,每个分支的query会关注到另外两个分支的key/value。
RGB分支在生成纹理时,会参考深度提供的几何边界和光流提供的运动方向;深度分支在生成几何时,从RGB纹理中获取物体边缘等线索;光流分支在预测运动时,结合深度变化与纹理位移来校准方向。
JA中的cross-attention会为query和key施加帧级的3D旋转位置编码(3D RoPE),确保跨模态注意力仅在相同时间帧的空间对应位置生效,而非进行全局语义平均。消融实验显示,去除3D RoPE后,深度精度(δ1)从0.610降至0.450,光流误差(AEPE)从0.170升至0.210,说明空间级对齐至关重要。
分阶段训练:模态适配与联合对齐
三个分支无法直接从头联合训练:RGB分支继承了预训练视频模型的强先验,而深度与光流分支需要重新适配不同的数据分布。为此,RynnWorld-4D采用了三阶段策略。
Stage 1(模态适配):关闭JA模块,三个分支独立训练。深度和光流分支从RGB预训练权重出发,逐步适配到各自的目标分布。
Stage 2(冻结主干 + 训练JA):冻结三个分支的backbone,仅训练新插入的JA模块,用于建立跨模态对齐路径,同时不破坏已学到的模态内表示。
Stage 3(全参数联合微调):解冻所有参数,在完整数据集上进行联合SFT,进一步精化三模态协同。
此外,训练中采用Branch Dropout机制:随机丢弃深度或光流分支的输入(Stage 2概率0.2,Stage 3概率0.1),迫使JA从可见模态重建缺失模态。这一机制使推理阶段在部分帧深度估计有噪声时,模型仍能通过RGB和光流相互补偿。
数据构建:2.54亿帧4D数据的标注管线

图3:Rynn4DDataset 1.0的数据构成。
4D世界模型的核心瓶颈之一,是同时具备RGB、深度和光流标注的大规模视频数据几乎不存在。RynnWorld-4D的解决方案是自建Rynn4DDataset 1.0——融合人类第一人称活动视频(Epic-Kitchens、EgoVid)和多源机器人操作数据(RoboMIND、RDT-1B、Galaxea、RoboCoin、AgiBot),总规模超过2.54亿帧。
除数据规模外,标注质量同样关键。每一帧都经过三重标注:由Qwen3-VL生成细粒度语言描述,由Depth Anything 3估计深度图(统一归一化至0–5米),由DPFlow计算稠密光流。这套标注流水线使任意一段普通视频都能转化为带4D标签的训练样本,从而缓解真实4D标注数据稀缺的问题。
消融实验验证了数据规模的作用:去除大规模预训练后,光流误差(AEPE)从0.170升至0.729,恶化超过4倍。这说明仅靠少量任务数据,不足以学习复杂的时空动态先验,数据规模对4D世界模型具有决定性影响。
策略学习:单次前向推理生成动作
世界模型用于策略学习的常见方式为:先完整执行去噪过程生成未来视频,再由inverse dynamics model从视频中提取动作。这一流程的主要问题是延迟高——多步去噪、视频解码与逆动力学叠加在一起,高频闭环控制难以实现。
RynnWorld-4D-Policy不要求世界模型完成完整生成过程,而是直接从RynnWorld-4D的中间层特征中提取4D信息,具体是第15层Transformer block在diffusion timestep t=500时的hidden state。此时的中间latent已编码了未来的几何演化与运动趋势,但尚未被解码成可视化视频帧。
随后,一个Flow Former将高维特征压缩成固定大小的token,一个轻量的flow matching head通过4步ODE采样输出10步动作(54维)。整个推理仅需一次前向传播,无需迭代去噪。
在单张RTX 5090(FP8量化 + FlashAttention 3)上,完整推理周期约1.1秒。由于每次输出10步动作并行执行(action chunking),实际有效控制频率约9 Hz,可覆盖大多数人类尺度的操作任务。
实验结果:4D预测能力的量化验证
生成质量:几何精度与视觉保真度

表1:4D生成质量定量评测与结构消融。指标涵盖视觉保真度(RGB)、几何结构(Depth)与运动(Flow);N/A表示该基线不具备生成对应模态的能力。
在50段测试视频上,RynnWorld-4D的生成质量可从三个维度评估。
视觉保真度:与纯视频生成模型Wan-14B持平甚至更优(SSIM 0.754 vs. 0.536),说明引入深度和光流分支并未降低RGB质量,反而通过互约束提升了结构一致性。
几何精度:深度δ1为0.610,是TesserAct(0.279)的2.2倍、4DNeX(0.327)的1.9倍,验证了联合跨模态注意力的有效性。
运动精度:AEPE为0.170,是当前唯一能同时输出稠密光流场的4D世界模型;其他方法要么不生成光流(TesserAct、Free4D),要么不具备运动场输出能力。

图4:生成效果展示。RynnWorld-4D同步生成时间连贯的RGB、深度与光流序列,几何结构清晰、跨模态边界精确对齐。
定性结果呈现三个特征。第一是跨模态一致性:深度图中的几何边界与光流中的运动边界,均与RGB纹理变化精确对齐,模态之间无割裂感。例如机械臂拾取苹果时,深度图中苹果轮廓的变化与光流中苹果的运动向量保持同步。第二是物理真实性:无论人手操作还是机械臂轨迹,模型均能准确刻画物体位移和多接触点交互等复杂4D动态。第三是时序稳定性:生成序列在时间维度上结构稳定,未出现传统视频模型常见的物体闪烁或形状突变;即使在多物体近距离交互场景下,深度与光流分支的互约束也能有效抑制尺度抖动和形变。这些结果说明,在同一扩散去噪过程中联合建模RGB、深度和光流,三者之间形成了较强的物理互约束。
策略表现:双臂灵巧操作任务对比

图5:六项真实世界双臂灵巧操作任务示意及成功率对比。
策略评估在六项真实世界双臂灵巧操作任务上进行(每项35次试验)。硬件平台为天机M6双臂机器人,配备WUJI HAND灵巧手,通过RealSense D435i获取第一人称视角图像作为观测输入。对比基线包括Diffusion Policy、π0和π0.5。值得关注的对比结果包括:
双手物体传递(Hand-over):RynnWorld-4D-Policy成功率为28.57%,π0为2.86%,π0.5为0%。该任务需要推理两个高自由度末端执行器之间的相对三维距离与潜在自遮挡,2D策略难以完成,而RynnWorld-4D的4D latent本身就包含了这类几何信息。
盖子放置(Lid Placement)和碗具堆叠(Bowl Stacking):均达到65.71%,比次优方法高出8.5%。这两个任务对空间精度要求极高——盖子需对准盒口,碗需平稳叠放,深度与光流提供的显式几何信号在此发挥了关键作用。
关于π0/π0.5在这些任务上表现不佳的原因,论文给出了两点分析:其一,它们的预训练数据以平行夹爪为主,缺乏灵巧手先验;其二,在双手协作场景中,纯2D表征无法有效推理两个末端执行器之间的空间关系。这是表征空间的根本限制,而非单纯的数据量问题。
论文还进行了模态贡献的消融。仅使用RGB latent时,大多数任务成功率比完整模型低10–20个百分点;加入深度后,空间精度要求高的任务(如Hand-over、Bimanual Lifting)明显受益;加入光流后,运动敏感任务(如Block Pushing)表现提升;三者联合时达到最佳。这一结果验证了RGB-DF表征的协同价值:纹理提供外观语境,深度提供空间锚定,光流提供运动线索。
展望:4D世界模型的下一步
回望这条技术路线,具身世界模型正从二维视频想象走向四维物理推演。RynnWorld-4D首次在单一扩散框架内实现了RGB-深度-光流的协同生成,并证明这种4D预测能力可直接转化为真机闭环控制的增益。当然,约9 Hz的频率对超高频精密任务而言仍是瓶颈,单一第一人称视角也尚未覆盖多机协作——这些正是推理加速与多视角拓展的方向。而随着操作任务对精准三维理解的需求不断加深,能够同时预测几何与运动的4D世界模型,或许将成为连接感知与决策越来越关键的一环。
