李飞飞参与视频世界模型跨本体双向推演与动作画入
类型:热点整理2026-07-24
将机器人动作渲染为像素级运动轨迹,视频模型补全环境响应,实现正向预测与逆向生成的统一。跨机器人本体泛化能力强,在RoboCasa任务中成功率提升7至26个百分点,策略评估相关系数达0 982,逆向动作提取成功率为90%。
编辑|山辉
如果要让机械臂将咖啡机旁的杯子移动到桌上,需要经历哪些具体步骤?
在传统的模型驱动规划中,机器人通常先产生大量候选动作,再将这些动作交给世界模型进行预演,以评估哪个动作结果最理想。视频世界模型一般接收当前画面,以及关节角、末端位姿、夹爪状态等数值动作,生成执行动作后的未来视频。
但问题在于:对视觉模型而言,要建立某组数字与画面动作之间的对应关系,需要额外的学习成本。而且这种学习高度依赖特定机器人产生的训练数据,一旦更换机器人,这些数据的结构就会全部改变。
既然视觉模型更擅长处理画面,为什么不干脆把动作也“画”给它看呢?
近日,斯坦福大学、马里兰大学帕克分校与哈佛大学的研究团队联合发表论文《Masked Visual Actions for Unified World Modeling》。第一作者为Hadi Alzayer,李飞飞、吴佳俊、张吕敏等研究者参与。该团队提出Masked Visual Actions方法,将机器人的候选动作渲染成像素级运动轨迹,再让视频模型补全环境的响应。改变输入的实体后,同一个模型还能在两个方向上工作:给定机器人如何运动,预测环境将如何变化;给定目标物体如何运动,生成机器人可能采取的行为。

模型微调使用了约15小时的机器人交互数据,同一个模型可以支持正向预测、逆向生成、多种机器人本体、策略评估以及模型规划。在RoboCasa任务中,视频模型辅助规划带来了7至26个百分点的成功率提升;模型预测的策略表现与真实仿真结果达到0.982的相关系数;逆向动作提取管线在CoffeeServeMug任务上取得了90%的成功率。

翻译成视频就更容易理解了
视频世界模型通常直接预测未来图像或视频,其常见工作方式可概括为:当前图像+数值动作序列 → 未来视频。数值动作虽然能精确控制机器人,但和视频模型熟悉的像素信息之间存在表示差异。从一串动作数据到最终画面,中间还需要经过多层转换:动作数据 → 机器人姿态 → 相机投影 → 画面运动 → 环境响应。
Masked Visual Actions提前完成了这一转换。训练数据通过两种方式构造:一种是从真实视频中直接分割机械臂,另一种是根据机器人状态、URDF模型和相机参数渲染其运动。前者保留了真实视觉信息,后者便于在推理时自由输入新的动作轨迹。视频模型接收初始画面和这段机器人轨迹,再补全物体与环境的变化。

相比末端执行器点或机器人骨架,完整掩码还包含了机器人的形状、占用空间、遮挡关系以及潜在接触边界,模型能够直接“看到”动作过程。

这种表示方式也带来了更好的跨机器人本体泛化能力。在DROID训练分布内,完整掩码、末端执行器位置和机器人骨架都能较好地控制视频生成,差距并不明显。

在训练分布内,三种视觉条件表现接近
但当测试对象换成训练中未出现过的自定义夹爪,或直接换成BEHAVIOR中的双臂机器人后,差距就迅速显现出来。

换成双臂机器人后,完整像素掩码对机器人形态的保持明显更稳定。末端点和骨架只提供稀疏的运动信息,模型容易将新机器人改写成训练时见过的形态,甚至凭空生成另一台机器人;直接接收原始动作状态的Ctrl-World,在双臂机器人上也容易生成静止或损坏的画面。Masked Visual Actions则直接给出新本体的完整轮廓与运动,因此能够较稳定地保留机器人形态,并继续预测它与环境的交互。
换句话说,不同机器人的关节数量、动作维度和控制方式可以完全不同,但进入视频模型后,都被转换成了同一种信息,这让跨机器人本体泛化成为可能。
两种填空方式,零样本切换逆向建模
实际上,在此之前已有研究者尝试过类似思路,例如BridgeV2W将机器人动作渲染成像素对齐的本体掩码,再注入预训练视频模型。这种表示能缩小动作坐标空间与视频像素空间之间的差距,并支持不同机器人本体。
相比之下,Masked Visual Actions把问题进一步抽象为:在一段交互视频中,可以提供任意一部分实体的运动参考,再让模型补全其余实体。用填空题来类比,BridgeV2W的题目基本固定为:已知机器人动作,填写环境部分。而Masked Visual Actions则概括为:已知交互中的部分实体,填写剩余部分。
于是,模型获得了一种逆向使用方式:希望物体这样运动,机器人应该怎么动?

实际上,论文中的模型主要使用机器人掩码进行正向训练,推理时却能直接接收目标物体轨迹,零样本切换到逆向建模。作者认为,这种能力来自视觉条件与视频模型内部表征之间的对齐。在更完整的机器人系统中,这两种推理也许可以连续配合:机器人接到“把杯子放到桌上”的任务后,逆向推理先提出可能的动作方案,正向模型再预演这些方案的结果,系统选择可靠轨迹并执行。完成一小段动作后,摄像头重新观察场景,再进入下一轮规划。
更少的数据,更彻底的接口统一
研究团队基于Wan-Fun-Control 2.2 14B进行LoRA微调,数据来自DROID真实机器人视频和RoboCasa仿真环境,包含成功与失败轨迹。其中失败样本十分关键——世界模型需要学会错误动作会产生什么结果,否则它可能对每一条候选轨迹都生成一个看似成功的未来。
论文中还提到,模型微调使用了约15小时的机器人交互数据。附录显示,训练数据大致包含1000条DROID演示和4000条RoboCasa样本。模型使用8张H200训练约10000步,耗时4天。这套系统依赖14B基础模型和较强硬件,整体并不轻量。它的数据效率主要体现在不需要从头训练机器人世界模型,而是通过少量机器人样本激活视频模型已有的运动、接触与物体交互知识,并覆盖了多种能力:预测机器人动作产生的环境变化;根据目标物体运动生成机器人行为;适应训练中未出现的机器人本体;以及从生成视频中提取可执行行为等。
实验结果
实验中先由Diffusion Policy为同一场景采样多条候选动作,视频模型生成对应的未来,Gemini 3.1 Pro再从任务进度、物理真实性和接触情况等方面评价每段视频,最后选择最优动作执行。
模型规划
在关闭微波炉、打开抽屉、打开洗碗机、关闭冰箱等任务中,加入视频模型规划后,成功率获得了7至26个百分点的提升。候选数量增加时,整体表现也随之提高。

这相当于为机器人增加了推理时计算:原有策略负责提出方案,视频模型负责预演,视觉语言模型负责筛选。策略参数保持不变,系统通过比较更多未来结果来提高决策质量。
策略评估
作者将同一套机器人策略分别放入RoboCasa仿真环境和视频世界模型中执行。模型生成视频中的成功率,与真实仿真结果达到了0.982的相关系数。

在真实机器人实验中,生成视频所体现的任务进度与实际演示也较为接近。不过,模型仍然存在明显的乐观倾向,常常想象出比现实更多的任务进展。因此,它更适合作为策略开发早期的低成本筛查工具,距离替代仿真器和实机测试还有较大差距。
逆向动作提取
在CoffeeServeMug任务中,系统输入杯子的目标运动,视频模型生成机械臂完成操作的过程,逆动力学模型再提取可执行动作。完整管线取得了90%的成功率,高于论文中对比的Diffusion Policy、ACT和SmolVLA。

这里的90%来自“视频模型+逆动力学模型”的组合。视频模型提供行为过程,逆动力学模型负责将过程还原为控制数据。
总结
Masked Visual Actions将机器人动作、环境响应和结果评价纳入同一个视觉空间,并将正向预测与逆向生成统一为条件视频补全。它也清楚地展示了视频模型在机器人系统中的一种分工方式:策略提出动作,视频模型预演未来,视觉语言模型评价结果,控制器完成实际执行。
现阶段,这套方法仍受到基础视频模型能力的限制。模型学习的是交互相关性,缺少严格的因果与物理约束,因此仍会出现无接触运动、物体瞬移以及任务结果凭空完成等现象。视频生成的速度和成本也限制了实时闭环控制。逆向流程还需要额外的逆动力学模型,最终执行始终依赖数值动作和底层控制器。