游乐游手机版
首页/AI热点日报/热点详情

Cosmos 3 Edge 详细介绍

类型:热点整理2026-07-21
NVIDIA开源40亿参数的世界模型Cosmos3Edge,专为边缘设备设计,支持机器人和视觉AI实时推理与动作生成。该模型在NVIDIARTX、Jetson等硬件上实现高吞吐低内存推理,在视觉分析基准和机器人策略学习领域达到领先水平,并提供后训练脚本供开发者定制。

真实世界广阔无垠,物理AI系统要在其中顺畅运作,就必须理解场景如何变化、预判接下来可能发生什么,并判断一个动作会对世界产生什么影响。机器在工厂、仓库、医院乃至更边缘的环境里工作。想要在这些环境中感知并行动,它们需要模型在内存受限的系统上,依然能拿出数据中心级别的性能表现。

介绍 Cosmos 3 Edge

今天,NVIDIA在Hugging Face的Cosmos 3仓库中正式开源了Cosmos 3 Edge。这是一个拥有40亿参数的开源世界模型,专门帮助机器人和视觉AI袋里理解周围环境、实时推理,并在边缘设备上生成机器人的动作指令。

该模型在NVIDIA多款边缘计算产品上都能实现高吞吐、低内存的推理,包括NVIDIA RTX PRO GPU、NVIDIA DGX、NVIDIA GeForce RTX™ GPU,以及新发布的Jetson T2000和T3000模块等Jetson系列设备。

它被设计成一个紧凑的开源模型,作为小型视觉语言模型(VLM)使用时,能在实时推理中兼顾顶尖的吞吐量和准确性。经过后训练,Cosmos 3 Edge还能作为世界动作模型(WAM)运行——在机器人控制分辨率(640×360)下,它能在NVIDIA Jetson Thor上实时推理,每次推理生成32个动作,实现15Hz的实时控制。

在同类(40亿参数)模型中,Cosmos 3 Edge在视觉分析基准VANTAGE-Bench上排名第一,在机器人策略学习方面也达到了业界领先水平,为智能基础设施和机器人领域树立了新的标杆。

什么是世界建模?

世界模型的核心,是学习环境随时间如何变化。它表征物体、运动、空间关系,以及动作带来的影响。

想想看,一个机器人伸手去抓物体——识别出物体只是第一步。它还必须知道物体在哪里、自己的夹爪如何移动、接触时可能发生什么,以及哪个动作最有可能成功完成任务。世界模型帮助机器人推理这些关系。它可以预测某个动作的视觉结果,从场景变化反推导致变化的动作,或者生成一个动作来达成期望的效果。

Cosmos 3 Edge将这些能力整合到一个模型里,直接运行在设备端。它通过共享的表征,让物理AI系统理解当前世界状态、模拟可能的未来,并将这些未来与动作连接起来。

双Transformer塔,共享表征

Cosmos 3由两个Transformer塔组成:

  • 自回归塔:处理视觉和文本token,用于理解和推理。
  • 扩散塔:处理视觉、音频和动作token,用于预测、生成和神经模拟。

两个塔各自拥有独立的归一化层和多层感知器,但共享多模态注意力层——这使得语言、视频、音频和动作之间的信息得以对齐。这种设计让模型在生成输出之前,可以先对场景进行推理。根据任务不同,Cosmos 3可以从自回归塔输出推理token,也可以从扩散塔输出去噪后的视频和动作token。

注意力模式也针对每种信息类型做了适配:语言使用因果注意力(每个token只关注它之前的token);扩散token则更广泛地关注可用上下文,支持连贯的预测和生成。这些组件共同赋予模型一个统一的表征:当前发生了什么、接下来可能发生什么,以及动作如何影响结果。

统一的动作表征

物理系统描述动作的方式各不相同。车辆的动作用自我位姿和移动来表示;相机用相机运动来表示;机械臂用末端执行器位姿表示;而手或夹爪还需要表示抓取状态。Cosmos 3将所有这些不同的具身形式映射到一个统一的动作表征中。

动作被编码为紧凑的几何向量,包含三部分:

  • 平移
  • 旋转
  • 操作状态

这就建立了控制信号与视觉世界结构之间的直接连接。模型可以将像素的变化与物理运动、空间关系和控制输入关联起来。结果就是,生成的视频不再只是视觉预测——它还能表示世界在响应某个动作时预期会如何变化。这为开发者提供了扎根于运动、控制和因果关系的训练数据。

策略模式

作为策略模型时,Cosmos 3会同时预测一个动作及其预期的视觉结果。模型能生成系统应该做什么,并模拟接下来可能发生什么。这直接将世界建模与机器人策略训练和评估连接起来。核心逻辑很简单:输入当前状态,输出动作和视觉后果。

这些模式让同一个模型可以同时学习原因、结果和策略。动作信息可以在模型中双向流动:Cosmos 3 Edge既能预测动作的效果,也能从效果反推动作。

提示:拿起香蕉,放到盘子里。

此外,NVIDIA还同时发布了Cosmos 3 Edge Policy (DROID)——一个在DROID数据集上后训练得到的机器人操作策略,专门用于拾放任务,并附带后训练脚本。开发者只需使用一个由H100或NVIDIA DGX Station组成的小型集群,就能高效地微调Cosmos 3 Edge,使其适配目标工作负载,然后部署到NVIDIA边缘和加速计算平台上。

后训练样本:进一步提升性能

除了基础模型,还同时发布了参考后训练检查点和训练配方,帮助开发者针对自己的应用场景调整和优化Cosmos 3。Cosmos 3是一个开放的世界基础模型平台。当模型用高质量、领域特定的数据后训练后,其精度在专用应用上会持续提升。Cosmos作为起点,开发者可以利用开源框架构建领域适配的世界模型。后训练能在保持输出质量的同时提升模型性能。为了展示这一流程,还发布了Cosmos 3 Super 4-Step蒸馏检查点及后训练脚本——为64B模型提供了一个更快的参考实现,帮助开发者将Cosmos迁移到自己的领域并获得更好的下游性能。

Cosmos 3 Super 4-Step(文本到图像与图像到视频):这些是经过分布匹配蒸馏的检查点和脚本,将扩散去噪步骤从35–50步减少到仅4步,在保持图像和视频质量的前提下,推理速度提升最高25倍。

这些示例是开发者可以基于其构建的参考实现。使用开源训练脚本,你可以为自定义机器人策略后训练Cosmos 3 Edge,或者蒸馏Cosmos 3 Super以获得更快的、针对你应用定制的图像和视频生成能力。

Cosmos 3 Edge通过共享的世界表征,将理解、预测、模拟和动作连接在一起。开发者可以将其部署在更靠近传感器的设备端。这个模型既可以作为推理器使用,也可以作为动作生成器使用。利用开放的Cosmos框架,你可以对模型进行定制和专业化。

NVIDIA将继续推进Cosmos 3在物理AI中的应用,后续将带来交互式世界生成、驾驶场景模拟和机器人策略等方面的改进。同时,也在投资更快的推理和更高效的后训练,覆盖更广泛的硬件平台,以减少构建下游模型所需的时间和算力。这包括优化Cosmos 3检查点与vLLM等开源推理和优化框架的结合,更多优化和开发者工具即将推出。

来源:https://www.bestblogs.dev/article/2e56aac4fb?utm_source=rss&utm_medium=feed&utm_campaign=resources&entry=rss_article_item

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。