游乐游手机版
首页/AI热点日报/热点详情

十分钟读懂LaWAM:机器人如何在隐空间中想象未来动作模型解析

类型:热点整理2026-08-21
转载自公众号:敢敢AUTOHUB0 简介这两年,从 VLA、世界模型,到各种“动作 + 未来预测”的混合方案,几乎每隔一段时间就会出现一个新概念,让人不禁怀疑这到底是技术范式演进,还是术语不断翻新。LaWAM 是其中少数值得认真读完论文、代码和消融实验的一项工作,因为它没有继续堆叠更大的视频生成底

转载自公众号:敢敢AUTOHUB

0. 简介

这两年,从 VLA、世界模型,到各种“动作 + 未来预测”的混合方案,几乎每隔一段时间就会出现一个新概念,让人不禁怀疑这到底是技术范式演进,还是术语不断翻新。LaWAM 是其中少数值得认真读完论文、代码和消融实验的一项工作,因为它没有继续堆叠更大的视频生成底座,而是把“未来预测”整体迁移到一个紧凑的视觉隐空间中。它仅用一个230M参数的小模型,就实现了相比像素空间世界模型最高24 倍的推理加速,同时将 LIBERO 成功率提升到98.6%。这篇文章会系统拆解论文的核心思路、关键代码、训练目标与实验结果,让你看懂它为什么推理更快、效果更准,也能理解它在具身智能与机器人控制路线图中的实际位置。

为了让没看过原论文的读者也能顺利跟上,本文会尽量按照论文本身的逻辑展开:先讲清研究动机与整体框架,再逐层分析两条核心机制、训练目标与推理流程,最后落到实验指标和它在技术路线中的定位。

论文地址:https://arxiv.org/abs/2606.15768
项目主页:https://rlinf.github.io/LaWAM/
代码仓库:https://github.com/RLinf/LaWAM
Hugging Face 模型:https://huggingface.co/collections/jialei02/lawam-checkpoints

1. 为什么这么做

1.1 从一条折毛巾视频看清问题

设想一台双臂机器人正在执行折毛巾任务:先把毛巾抖开并铺平,然后沿长边折两次,再沿短边折一次。即便是熟练的遥操作员,完整执行这套流程也往往需要约七十秒。真正棘手的问题在于,真实物理世界不会停下来等待机器人完成计算——布料会在动作过程中持续滑动、起皱、回弹,上一刻看起来合适的抓取点,下一刻可能就已经偏移了几厘米。如果机器人的“思考”,也就是对未来状态的预测,慢了几百毫秒,那么等动作真正执行时,它面对的已经不是预测中的那块布了。这正是动态可形变物体操作的核心挑战:未来状态必须在动作还能及时调整之前被预测出来,而不是等动作结束后再补做判断。

直觉理解:可以把它类比成高速公路并线。经验丰富的司机不是等变道完成后才看后视镜,而是在打方向前,就已经在脑中预演车辆会滑向哪个位置。机器人如果想稳定操作,也必须在动手之前就形成“接下来场景会如何变化”的预判,而且这份预测还必须足够快,快到能赶在动作执行之前生成出来。

1.2 现有路线的三个缺口

过去一种非常直观的做法,是先让模型“画出”未来画面,再让机器人根据这段未来画面来决定动作,这条路线通常被称为像素空间的世界动作模型(World-Action Model, WAM)。它会先生成一段未来视频或若干未来图像,再由策略模块据此输出动作。对于人类来说,这种未来预测结果很好理解,因为它和人眼看到的世界非常接近。但对于需要实时控制的机器人系统来说,逐像素重建整段未来画面,意味着大量算力被消耗在纹理、光照、背景等和“下一步应该怎么动”关系不大的细节上。论文中的对比很能说明问题:在相同评测设置下,代表性的像素 WAM 方法 LingBot-VA 完成一次策略推理需要4482 毫秒,而普通 VLA 模型 π₀.₅ 只需要 220 毫秒。

如果把现有方法的主要问题拆开看,缺口集中在三点。第一,多数 WAM 预测的是未来图像或视频,因此模型能力大量投入在像素级生成,而不是更紧凑、更贴近动作决策的动态信息建模上。第二,迭代式未来生成天然带来高延迟,前面提到的 4482 毫秒就是典型代价。第三,对于机器人操作任务真正有价值的未来,不只是“视觉上合理”的一段画面,而应该明确告诉策略:“接下来这段动作会把场景推向什么状态”。这三点叠加在一起,使得“想象未来”在真实机器人控制闭环中变成了一种昂贵能力。LaWAM 想解决的,正是如何让未来预测既高效又真正服务于动作生成

2. 整体框架:把未来搬进隐空间

2.1 输入输出接口与隐空间视觉子目标

LaWAM 的核心出发点可以概括成一句话:把整个未来预测过程从像素空间整体迁移到视觉隐空间。它不再生成未来图像,而是直接预测一个与动作相关的未来特征,论文将其称为隐空间视觉子目标(latent visual subgoal)。直观来看,这相当于一张专门提供给动作策略使用的“未来动作提示图”:它保留了物体将如何移动、交互区域会出现在哪里、当前动作会把场景推向什么状态等真正与控制相关的信息,同时省去了纹理、背景、光照等对下一步动作帮助有限的视觉细节。这张“提示图”并不是给人类看的,而是直接输入给动作生成模块去解析并输出动作块。

先看数学形式上的基线,这有助于理解不同技术路线究竟差异在哪里。一个标准 VLA 不会显式建模未来,它直接学习在当前观测 和指令 条件下生成整段动作块 的条件概率,关于场景如何演化的全部知识都被隐式压缩进网络参数之中:

世界动作模型则采用另一种思路,它把一个预测出来的未来 (动作时域末端的观测)显式提供给策略,让动作生成能够参考“接下来场景会变成什么样”。这样,原本的联合概率就可以自然分解成“未来预测”和“逆动力学”两部分,前者负责想象未来,后者负责把想象结果映射回具体动作:

联合未来预测

这里第二项扮演逆动力学模型(Inverse-Dynamics Model, IDM)的角色,把“目标视觉未来”映射为动作。问题的关键在第一项:如果 是高维像素图像或未来视频,那么这一项的生成成本会非常高。LaWAM 保留了这种“未来条件”的建模结构,但把未来整体映射到冻结视觉编码器的特征空间中,从根本上绕开了昂贵的像素重建。

2.2 训练与推理的关键不对称

这套框架最有意思的地方,在于训练阶段和推理阶段存在明显的不对称。训练时,模型可以看到真实未来观测,因此能够反推出“动作意图”,再用它去监督世界模型;但在推理时,真实未来还没有发生,模型只能先自己猜出动作意图,再由世界模型把它展开成子目标。

这种不对称正是后续所有设计的起点:它解释了为什么需要一个只在训练阶段存在的逆动力学编码器,也解释了为什么在推理阶段必须用策略先验去替代它。论文给出的两阶段总览图,正是围绕这种训练—部署不对称展开的。

3. 第一条核心机制:隐动作模型 LAM

3.1 为什么不能直接翻译人手动作

LaWAM 的技术基础是隐动作模型(Latent Action Model, LAM)。它最初要解决的是一个非常现实的问题:如果想让机器人从人类第一视角视频中学习动作规律,就很难直接把“人手怎么动”翻译成“机械臂各关节该怎么转”——人手关节结构、机械臂自由度、夹爪形态以及控制频率都不一致,强行对齐几乎必然带来误差。更合理的做法,是先学习一种抽象的动作意图,它不关心某个关节具体转了多少度,而是描述“当前画面到未来画面之间发生了什么变化”。这样一来,大量没有动作标注的人类视频也能被利用起来,成为机器人学习物理变化和交互规律的重要数据来源。

3.2 被复用的解码器:从辅助件到世界模型

LAM 的结构非常对称:一个逆动力学编码器观察“当前视觉状态 + 未来视觉状态”,从中推断出一个隐动作;一个解码器再基于“当前状态 + 隐动作”预测未来状态。过去许多工作都把重点放在隐动作本身,比如它应该是离散还是连续、如何正则化、是否能跨机器人本体迁移等,而解码器通常只被视为训练阶段的辅助模块,预训练结束后就直接丢弃。LaWAM 的关键创新恰恰在于反过来使用这个解码器。因为这个解码器实际上已经学会了“给定当前视觉特征和动作意图,预测未来视觉特征”,这本质上就是一个运行在隐空间中的世界模型。论文将它命名为隐空间世界模型(Latent World Model, LaWM)。下面这张图展示了 LaWM 预测出的子目标如何通过热力图标出即将发生交互的关键区域,并引导机械臂逐步推进操作。

3.3 代码透视:隐空间中的 LAM

下面这段是第一阶段的核心训练逻辑:在冻结视觉编码器的特征空间中训练 LAM。它先把当前帧和未来帧编码为特征,逆动力学编码器据此推断隐动作,再由解码器重建未来特征,同时配合一个轻量辅助头,强制隐动作更多编码具身运动信息。整个流程的结果是,模型不仅学会了“如何从前后两帧抽取动作意图”,也学会了“如何利用这个意图在特征空间中展开未来画面”,而后者正是后续会被保留下来反复复用的关键能力。

# 第一阶段(说明性代码,对应论文 Sec 3.2):在冻结特征空间训练 LAM# f_psi 冻结(蒸馏版 DINOv3 ViT-B/16),编码器 / 解码器各为 24 层 Transformeru = f_psi(o) # 当前观测特征u_T = f_psi(o_T) # tau 秒后的未来观测特征(机器人 1.2s / 人类视频 0.4s)z = q_phi(u, u_T) # 逆动力学编码器:推断隐动作后验 z ~ N(mu, sigma)u_T_pred = LaWM(u, z) # 前向解码器:通过 AdaLN 注入 z,预测未来特征s_T_pred = g(s, z) # 辅助头:让 z 偏向具身运动而非纯视觉外观L_wm = mse(u_T_pred, u_T) # 未来特征预测误差L_aux = mse(s_T_pred, s_T) # 末端执行器状态辅助损失L_kl = kl_divergence(q_phi(u, u_T), Normal(0, 1))L_lam = L_wm + L_aux + beta * L_kl # beta = 1e-5

这段代码主要完成了三件事:把视觉变化编码成隐动作、用隐动作重建未来特征、再通过 KL 项把隐动作空间正则化成一个便于后续策略建模的分布。为什么要在 DINOv3 的冻结特征空间里完成这些,而不是直接在像素空间上做?因为预训练视觉编码器已经提取出了语义信息和空间结构,模型无需再浪费大量容量去学习纹理级重建,这正是它能够做得更小、更快的基础。一个容易被忽视但非常重要的工程细节是,由于 和 都由同一个物理时间间隔定义,学出来的子目标对应的是一段固定真实时间,而不是某个数据集特有的帧间隔,这也为后续跨控制频率、跨机器人本体的时间对齐打下了基础。

4. 第二条核心机制:隐空间世界模型 LaWM

4.1 设计动机:隐动作不能单独当输入

一个自然的问题是:既然隐动作已经能跨本体表达动作意图,为什么不直接把它作为策略的最终输入?这里需要明确隐动作和隐空间子目标各自承担的角色。隐动作是一个高度抽象的转移变量,它擅长跨不同机器人平台表达“把某个物体往某个方向移动”这样的意图,但它本身并不包含当前场景的具体视觉上下文。只有当 LaWM 把隐动作放回当前隐空间视觉状态中,并展开为带有具身信息的子目标后,它才真正对动作生成有帮助。换句话说,隐动作负责“抽象表达转移”,LaWM 负责“把这种转移落到当前场景”,两者结合,才构成从人类交互视频到机器人动作生成之间的有效桥梁。

难点提示(隐动作 vs 隐空间子目标):可以把隐动作理解为一句导航提示“前方路口右转”,它在任何城市、任何车辆上都成立,但仅靠这句话并不能直接驾驶;而隐空间子目标则相当于把这句话叠加到你当前挡风玻璃看到的画面上,明确标出“你这辆车此刻该朝哪个像素区域移动”。前者具备迁移性但不可直接执行,后者可执行但依赖具体场景,LaWM 的作用正是把前者翻译成后者。

4.2 AdaLN 注入与训练稳定性

LaWM 解码器向网络中注入隐动作的方式,看似是实现细节,实际上会显著影响训练效果。论文采用的是自适应层归一化(AdaLN)来进行条件化,而不是 Genie 使用的加性 token 注入。加性注入会让隐动作范数的波动直接平移所有视觉 token,从直观上看,在跨本体混合训练场景下,这种加性偏移很容易导致视觉 token 整体漂移,进而让训练损失出现尖峰和不稳定现象。相比之下,AdaLN 会把隐动作转化成缩放与偏移参数,去调制归一化后的特征,本质上属于“乘性调制”而非“加性平移”,因此在多机器人本体联合训练时往往更稳定。

4.3 代码透视:策略驱动的子目标

第二阶段的目标,是把预训练好的 LaWM 接入到推理时真正可用的机器人策略中。第一阶段中的逆动力学编码器在部署时无法使用,因为它需要尚未发生的未来特征,因此第二阶段要训练一个策略先验,直接从当前观测和语言指令预测隐动作,再通过冻结的 LaWM 生成子目标。换句话说,第二阶段的核心,就是把第一阶段那个“必须先看到未来才能工作”的编码器,替换成一个“只看当前就能预测未来意图”的策略先验,从而让整套系统在推理阶段完全摆脱对真实未来的依赖

# 第二阶段(说明性代码,对应论文 Sec 3.3):把冻结 LaWM 接入 VLA 策略z_hat = policy_prior(o, l) # 策略先验预测隐动作u_hat_T = LaWM(u, z_hat) # 单次前向解码出隐空间子目标a_chunk = action_expert(o, l, u, u_hat_T) # Alternate-DiT:语义流 × 动态流 交替L_distill = mse(z_hat, z.detach()) # 隐动作蒸馏:z 来自第一阶段后验(教师)L_wm = mse(u_hat_T, u_T) # 监督策略驱动出的子目标L_act = flow_matching_loss(a_chunk, a_gt) # 动作的条件流匹配损失L = lam_distill * L_distill + lam_wm * L_wm + L_act # lam_distill = lam_wm = 0.1

这段代码背后包含两个必须协同工作的关键机制。第一是隐动作蒸馏,它让策略先验学会稳定驱动 LaWM,需要借助第一阶段后验提供的直接监督,才能可靠地“启动”这个隐空间世界模型。第二是知识隔离,它在策略训练时保护 LaWM,避免动作专家的梯度反向传播回去,破坏其已经学到的通用场景演化规律。下面这张作者绘制的概念图,把这套两阶段数据流与梯度边界同时画了出来,更容易理解哪些模块在训练、哪些模块被冻结,以及梯度是在哪里被切断的。

5. 训练时的监督模块:两阶段如何衔接

5.1 第一阶段:学世界怎么变

第一阶段学习的是 LaWM,也就是隐动作模型中的前向解码器。每个训练样本包含一个当前观测 和一个在固定物理时间间隔 之后采样得到的未来观测 ,编码成特征对后,逆动力学编码器先推断隐动作,再由解码器预测未来特征。形式化来看,记冻结视觉编码器为 ,第一阶段要学习的关系是:

这里 是隐动作后验,本质上可以看作一个隐空间逆向动力学模型,而解码器则被保留下来作为 LaWM。一个看起来很轻量、但实际非常重要的辅助信号是:一个小型预测器使用“当前末端执行器状态 + 隐动作”去预测未来状态,目的是迫使隐动作更多编码具身运动信息,而不是只捕捉视觉外观变化。预训练完成后,这个辅助头会被移除;后验编码器则继续保留,用于在第二阶段产生“教师隐动作”。

5.2 第二阶段:学策略怎么开

部署时,真实未来特征 还没有发生,这正是训练与推理不对称的根本原因。策略必须依靠当前观测先预测隐动作,再用这个隐动作去驱动冻结的 LaWM 生成子目标,整个链条都不再依赖任何真实未来信息。因此,推理阶段的因子分解相比训练阶段,多出了一个至关重要的“策略先验”项:

策略先验动作专家

它的读法是:策略先验 先预测隐动作 ,冻结的 LaWM 再把它确定性解码成子目标 ,动作专家 最后基于当前上下文与这个隐空间子目标生成动作块。训练时使用真实的 作为监督目标,推理时使用策略驱动出的 作为子目标,前者用于学习,后者用于部署,两者通过同一个 LaWM 串联起来。

5.3 知识隔离与隐动作蒸馏

这两个机制能否配合好,直接决定第二阶段能不能真正奏效。隐动作蒸馏为策略先验提供了来自第一阶段后验的直接监督;如果没有它,策略先验只能通过动作损失间接学习如何驱动 LaWM,监督信号会非常弱。知识隔离则在反向传播时切断动作专家到 LaWM 的梯度;如果没有它,针对下游任务优化的动作梯度会逐步污染 LaWM 已经学到的、更通用的场景变化规律。后面的消融实验会证明,少了任何一个机制,长时程任务的表现都会明显下降,二者缺一不可。这种“既要驱动世界模型、又要保护世界模型”的设计,本质上是在通用世界知识和任务特定策略之间,划出清晰的功能边界。

6. 推理时的执行模块:一次前向

6.1 推理 generate 流程

把训练逻辑理顺之后,推理流程反而显得非常直接,而这种简洁恰恰就是低延迟的来源。部署阶段真实未来不可见,因此策略只能自己先在隐空间中“猜”出未来,而且整个过程只预测一次,不做任何迭代式反复生成,这一点从根本上决定了它的时间效率优势。

# 推理(说明性代码,对应论文 Sec 3.1 因子分解)import torch@torch.no_grad()def infer(o, l): u = f_psi(o) # 1) 编码当前观测 z_hat = policy_prior(o, l) # 2) 预测隐动作(不依赖未来) u_hat_T = LaWM(u, z_hat) # 3) 单次前向,解码出隐空间视觉子目标 a_chunk = action_expert(o, l, u, u_hat_T) # 4) 基于子目标生成整段动作块 return a_chunk # 约 187 ms / 动作块

进一步对比这段流程与像素 WAM 的差异,会更容易理解 LaWAM 的价值。像素 WAM 在第 3 步通常需要迭代式地逐帧生成未来画面,每一步去噪都在重建大量对控制并不关键的像素;而 LaWAM 则把这一整段昂贵的迭代生成,替换成了“每个动作块只做一次隐空间子目标预测”。这不是简单把生成速度做快了,而是从根本上改变了未来信息进入策略的方式,这也是它与“加速版像素世界模型”之间最本质的区别。

6.2 延迟从何而来

LaWAM 的延迟优势主要来自两笔账。第一笔是算法账:未来被表示为一个隐空间子目标后,每个动作块只需要一次子目标预测,不必再迭代生成整段未来视频,计算资源可以集中在动作真正需要的未来状态上。第二笔是参数账:LaWM 本体只有 230M 参数,相比那些基于 5B 参数 WAN 视频生成模型构建的方案,世界建模部分参数量减少了大约 95%。两笔收益叠加后,2.3B 规模的 LaWAM 在每次动作块推理中只需要187 毫秒,相比 LingBot-VA 的 4482 毫秒,端到端推理延迟最高降低约24 倍。这意味着世界模型在机器人系统中的角色,不再是一个重型像素视频生成器,而变成了一个能提前为策略准备未来状态的轻量级组件。

7. 训练目标:损失装配

7.1 第一阶段损失

第一阶段的训练目标,需要同时兼顾“未来预测是否准确”和“隐动作空间是否规整”两件事,因此它采用前向预测主损失、KL 正则项以及一个轻量状态辅助项共同训练整个隐动作模型,三者组合得到最终总目标:

其中 用于训练 LaWM 去匹配未来特征, 训练辅助状态预测器,而 KL 项则把隐动作空间正则化到一个便于策略先验学习的分布形状上,权重 设得很小,目的是让重建误差主导训练,正则项只起到轻微约束作用。这里一个关键的工程取舍是: 不能设置过大。过大时,隐动作会被压缩成近似各向同性噪声,失去本应保留的动作语义;过小时,隐空间又会变得过于散乱,后续策略先验很难稳定拟合。

7.2 第二阶段损失

第二阶段的训练目标更复杂,因为它要同时完成三件事:教会策略先验预测隐动作、约束其驱动出的子目标贴近真实未来,以及让动作专家生成高质量动作。因此,论文把隐动作蒸馏、子目标监督和动作流匹配这三项损失按照各自权重进行组合,形成如下联合训练目标:

其中 是隐动作蒸馏项, 用来监督策略驱动出来的子目标, 是动作的条件流匹配损失,两个辅助权重都取 。直观来看,蒸馏项让策略先验去对齐第一阶段那个“见过未来”的教师,子目标监督项保证它驱动 LaWM 时不会跑偏,而真正决定动作输出质量的主力仍然是动作损失本身。

解读:两个辅助损失的权重都只有 0.1,主导训练的仍是动作流匹配损失。这说明蒸馏和子目标监督的作用更像是“塑形”而不是“主控”——它们负责把策略先验和 LaWM 拉到正确的工作状态,而最终动作效果的优劣,还是由主损失来决定。这种“小权重却支撑关键结构”的现象,在世界模型和机器人策略学习工作中非常常见。

8. 一个易忽略的细节:混频数据的物理时间对齐

8.1 控制频率不一致带来的歧义

真实机器人数据通常来自多种不同平台,控制频率也并不统一:有的平台是 5 Hz,有的是 20 Hz。同一个“第 i 个动作 token”,在不同控制频率下所代表的真实物理时间并不相同,这会让模型在混合数据训练时产生明显歧义。LaWAM 的处理方式是:每个数据分支保留各自原始控制频率,但统一使用固定的物理时间间隔 来定义每个动作块。对于原生频率为 的分支,其离散动作步数为:

这样,无论 token 数量多少,时域末端始终对应相同的真实时间长度。举例来说,在同一个 下,5 Hz 分支使用的动作 token 会比 20 Hz 分支更少,但两者都对应“同样物理时长之后”的未来视觉状态做监督,因此生成的子目标在不同数据集之间就具备可比性。这种以物理时间而不是帧数为统一锚点的设计,使来自不同平台、不同采样率的机器人数据能够放进同一个训练体系中而不彼此冲突。

8.2 正弦物理时间编码

动作专家还必须知道每个动作 token 在真实物理时间轴上的位置,否则它无法把子目标和动作在时间上准确对齐。由于 在不同数据分支中不一致,单靠 token 索引会产生歧义——同一个索引在不同频率下对应的真实时间点并不相同。因此,论文为每个 token 增加了一个正弦物理时间编码来消除这种歧义。记 token 的时间戳为 秒,其编码为:

工程价值:这个看似边角的小设计,其实是“用海量异构机器人数据预训练统一基座模型”能够成立的重要前提之一。论文专门构造了一个可控实验:从同一批 20 Hz 数据中下采样得到 10 Hz 和 5 Hz 版本,再与原始数据混合训练。结果显示,不加入物理时间编码时,成功率相对纯 20 Hz 上界会明显下降;加入之后,性能基本恢复到上界附近。对于两个物理时间相同的 token,即便它们的索引不同,也会得到相同编码,从而彻底消除歧义。

下面这段代码把混频对齐的两个关键步骤串联了起来:先根据物理时间间隔计算当前分支的动作步数,再为每个 token 生成正弦时间编码并叠加到动作表示上。这样一来,读者既可以对照前面的公式逐行理解它的工程实现方式,也更容易迁移到自己的多频率机器人数据处理管线中。

# 混频对齐(说明性代码,对应论文附录 C.3):以物理时间而非 token 索引为统一坐标import mathH_b = round(tau * h_b) # 分支 b 在 tau 秒内的离散动作步数(5Hz 比 20Hz 少)t = i / h_b # token i 的物理时间戳(秒)omega = [math.exp(-math.log(P_max) * k / max(K - 1, 1)) for k in range(K)]phi = [f(t * w) for w in omega for f in (math.sin, math.cos)]action_token[i] = action_token[i] + phi # 物理时间相同 → 编码相同,即便索引不同

9. 总结

LaWAM 的核心贡献,并不是再提出一个新术语,而是改变了“未来预测如何进入机器人策略”的形式:它把原本昂贵、面向人类可视化的一段未来视频,替换成了一个轻量、面向策略决策的隐空间视觉子目标。98.6% 的 LIBERO 成功率、91.22% 的 RoboTwin 平均成功率,以及 187ms 配合 24 倍推理提速,这三个关键指标放在一起,已经足以让这套架构进入下一代高效世界动作模型的重要候选名单。它说明了一件非常关键的事:在具身智能和机器人控制中,“未来”并不需要被画得足够逼真,只要它对动作决策真正有用,并且能够足够快地算出来。

当然,这套方法也并非没有待补齐的环节。移动相机条件下的自运动解耦,以及细粒度可形变动态数据的覆盖,这两个问题依然悬而未决——前者决定它能否从固定相机场景进一步走向人形机器人与移动机器人,后者则决定它能否真正处理精细布料、绳索等更高难度的复杂操作任务。未来如果有更大规模、更丰富的真实交互数据,以及进一步开放的模型权重,再回过头检验这套隐空间世界模型范式能否稳定落地工业机器人和真实家庭场景,才会是更有说服力的验证。

来源:https://www.eefocus.com/article/2069935.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。