机器人领域的一项核心难题,是如何构建能够超越训练演示、具备更强泛化能力的策略模型。当物体的形状、摆放位置或环境光照发生变化时,在训练场景中表现良好的策略往往会失效。要想适应这些新条件,策略不仅要复现演示过程,更需要理解任务背后的物理规律。这种能力很大程度上取决于其所依赖的主干模型。
当前构建语言条件机器人策略的标准做法,通常是在预训练视觉语言模型(VLM)上增加动作模块,从而形成视觉语言动作(VLA)模型。这一方法在通用机器人操作和多任务操控中发挥了重要作用。然而,VLM 主干的设计目标是理解和描述世界,而不是预测世界如何变化。当任务需要对场景未来状态进行判断时,机器人恰恰需要这种动态建模能力。正因如此,越来越多研究者开始用视频世界模型替代语言主干,进一步构建世界动作模型(WAM)。NVIDIA 研究员 Jim Fan 曾在其机器人开发主题演讲中深入讨论这一方向,这一观点后来被概括为“VLA 已死,世界动作模型万岁”。
本文将重点探讨:后训练如何把 WAM 转化为面向具体任务的机器人策略,WAM 相比 VLA 有哪些优势,以及为什么开放的 NVIDIA Cosmos 3 世界模型,正在成为构建 WAM 的重要基础。
现在如何构建经过后训练的策略
在 VLA 范式中,预训练 VLM 负责提供对场景内容和语言指令的语义理解,而后训练阶段则学习如何将这种理解映射为机器人动作。如今,越来越多现代通用机器人策略都建立在这一技术路线之上。
不过,VLM 的优化目标主要是生成与图像相关的文本内容,却并不擅长建模场景随时间的演变过程。它无法真正推断:夹爪闭合后杯子会处于什么状态、毛巾会如何被折叠、物体被松开后会落向何处。也就是说,VLA 在语义泛化方面表现出色,但在面对未见行为和复杂环境时,物理层面的泛化能力仍然有限,因为其核心能力更偏向语言理解与视觉感知,而非世界动力学建模。
WAM 的变化
WAM 通过以视频世界模型为基础来构建策略,从而弥补动态建模能力不足的问题。由于主干模型本身已经学习了世界如何演变,后训练阶段无需从零开始教授动力学规律,因此更适合建立在具备物理先验的模型之上。NVIDIA 的研究论文 World Action Models is Zero-shot Policies 表明,联合预测视频与动作,能够带来 VLA 难以轻松获得的策略特性:
它从更多样的数据中学习。VLA 学的是把指令映射为轨迹,通常需要针对同一任务提供大量近乎一致的演示数据。WAM 学习的是物理规律:例如物体在推动、抓取或抛弃时如何移动。只要是交互数据,都可能成为有效训练信号。许多原本难以直接用于 VLA 的数据集,在 WAM 中都能发挥价值,同时也让数据采集成本更低。
它在开放世界场景中泛化更强。与语义知识相比,物理规律具有更强的通用性。物体滑动或下落的基本方式不会因为物体类别变化而改变,因此学会动力学的模型,可以把这种知识迁移到从未训练过的场景和动作之中。
它只需少量演示即可适配新的机器人。一个理解物理交互过程的模型,对任务专属数据的依赖显著降低,因此在迁移到新的机械臂、机械手或机器人平台时,通常只需要更少的额外演示。
对于制定机器人策略的团队来说,这些优势非常实际:达到既定能力所需的数据更少、在训练分布之外的表现更稳健、适配新平台和新部署方案的路径更短。这些能力本质上来自预训练主干,因此会体现在每一个经过后训练的策略模型中。
Cosmos 3 是强大的 WAM 基础
Cosmos 3 是基于 Mixture-of-Transformer(MoT)架构构建的全模态世界基础模型。多模态输入首先流经自回归 Transformer,用于推理和生成文本等离散 token;随后再引导扩散 Transformer 处理图像、视频、音频和动作等连续模态。文本通过 next-token 解码生成;其他内容(包括动作)则通过迭代去噪进行合成。单一模型即可覆盖这些不同模态,同时保持每种模态最适合的生成机制。Cosmos 3 提供三种规模:4B 的 NVIDIA Cosmos Edge、16B 的 NVIDIA Cosmos Nano,以及 64B 的 NVIDIA Cosmos 3 Super。
Cosmos 3 拥有大规模的物理世界数据,为后训练提供了扎实基础。其数据集包含约 7.67 亿张图像、3.48 亿段真实世界动态视频,以及 800 万个动作样本,覆盖机器人操作、自动驾驶、摄像机运动和第一人称运动等多个领域。

图 1. VLA 基于语义推理和机器人状态生成动作,而 WAM 会联合预测机器人动作与未来世界状态
从世界模型到机器人策略:
Cosmos 3 策略 DROID 模型
Cosmos 3 是实现机器人策略专业化的重要起点。Cosmos3-Nano – policy-DROID 是基于 Cosmos 3 Nano、面向 DROID 平台进行后训练的 160B 参数策略模型。DROID 平台采用带有 Robotiq 抓手的 Franka Panda 机械臂。4B 版本的 Cosmos3-Edge-Policy-DROID 也采用相同方式进行了后训练,适合端侧和嵌入式部署。在接收语言指令和多摄像头观测后,该模型能够输出机器人动作轨迹。其 Omni 基础具备三个关键特性:
它在执行动作时具备“想象”能力。当模型输出动作时,也能同时输出视频预测:如果这些动作被执行,机器人摄像头将会看到什么。动作和未来结果由同一个模型联合生成。
它保留了完整的 Omni 架构。后训练不会删减原有能力。策略检查点依然能够进行推理并生成视频,而不只是简单输出关节位置。
先验能力是可量化的。Cosmos 3 技术报告比较了两种在相同方法、相同数据和相同算力条件下训练得到的 DROID 策略:一个从基础检查点开始,另一个则从使用多领域动作数据训练得到的 Omni 检查点开始。结果显示,Omni Checkpoint 将 RoboLab 的成功率从 28.1%提升至 36.8%。这清楚说明,性能提升来自模型架构本身,而不仅仅是参数规模。

图 2. 机器人在桌面上观察到一根香蕉(左);模型预测的行动规划以文本形式展示
部署注意事项
WAM 承载的是完整的生成式世界模型,而不仅仅是一个动作头,因此其体量通常比紧凑型 VLA 更大。但 Cosmos 3 可以映射到不同部署层级,而不是被迫做单一取舍:
工作站服务(Nano,16B)。Cosmos3-Nano – policy 可部署在机器人附近的工作站上运行,而不必放在本体板载设备中。现实中的 DROID 部署方案中,该模型可由单张 NVIDIA RTX PRO 6000 提供服务,机器人通过网络实时传输观测数据,并接收返回的动作块。
设备端(边缘、4B)。Cosmos 3 Edge 可直接在嵌入式硬件上运行相同的策略负载。它支持机器人控制分辨率(640 × 360 观测),并可在 NVIDIA Jetson Thor 上每次推理生成 32 个动作,同时实现 15 Hz 的实时控制。NVIDIA 边缘计算平台,包括 RTX PRO GPU、DGX、GeForce RTX GPU 和 Jetson 系列,以及新的 Jetson T2000 与 T3000 模组,均可支持这一能力。
为何使用 Cosmos 3 构建机器人策略?
WAM 代表着机器人学习范式的一次重要转变:从“学习如何行动”,转向“学习世界如何变化”。Cosmos 3 让这种方法真正具备落地可行性:
开放基础与 SOTA 起点兼具。基础模型、数据集、后训练配方、已训练权重、评估工具和服务栈,均以允许商业使用的许可证对外发布,为企业和研究团队提供先进起点。
更快适应新任务。强物理先验能够显著减少新策略所需的任务专属数据。只需将你的数据转换为机器人学习生态中已记录的 LeRobotDataset 格式,然后运行已发布的 recipe,即可开始后训练。
一个基础模型,适配多种机器人。每一种新具身平台,例如 Franka、双臂系统、UR、WidowX,仍然需要各自独立的后训练流程。但所有这些模型都可以从同一个预训练基础出发,而不必从零开始训练世界模型,从而减少每个平台所需的演示数量。
开始使用
评估 WAM 是否优于当前 VLA 的最快方式,就是使用你自己的数据,对 Cosmos 3 中的 WAM 进行后训练,并将结果与现有方案直接对比。
